Vision Language Model(2024-2026年)。GPT-4V/4o/o1(OpenAI・vision)・Claude Sonnet 4.6/Opus 4.7 vision・Gemini 2.5 Pro multimodal・LLaVA 1.6/Next(OSS・Llama base・$0)・CogVLM2 19B(Tsinghua)・MiniCPM-V 2.6(8B mobile)・InternVL 2.5(OpenGVLab・78B)・Qwen2-VL/Qwen2.5-VL(Alibaba・72B)・Pixtral 12B(Mistral・2024年9月)・Florence-2(Microsoft・vision encoder)・Llama 3.2 Vision 11B/90B・Molmo(Allen AI・OSS open weights+data)・2026年 OCR/Image Q&A実用化、ローカル動作可能。