Efficient Vision-Language Model inference and LoRA fine-tuning on ScienceQA, with dynamic resolution, visual-token compression, latency analysis, and accuracy–efficiency trade-offs using Qwen3.5-0.8B.
transformers pytorch lora dynamic-resolution vlm fine-tuning multimodal-learning peft multimodal huggingface model-efficiency vision-language-model qwen scienceqa qwen3 visual-tokens
-
Updated
Aug 19, 2026 - Jupyter Notebook