LLaVA

Large Language-and-Vision Assistant — the leading open multimodal model that combines a vision encoder with an LLM for image chat, VQA, and OCR.

View on AIWEBTOOLS.AI