Мультимодальные нейросети: модели с обработкой изображений и файлов
Модели, принимающие на вход не только текст: изображения, PDF и другие файлы. Подходят для анализа документов, распознавания и описания изображений, работы со скриншотами.
Обновлено: 20 августа 2026 · состав подборки обновляется автоматически по данным каталога
1Карточка →2Карточка →3Карточка →4Карточка →5Карточка →6Карточка →7Карточка →8Карточка →9Карточка →10Карточка →11Карточка →12Карточка →13Карточка →14Карточка →15Карточка →16Карточка →17Карточка →18Карточка →19Карточка →20Карточка →21Карточка →22Карточка →23Карточка →24Карточка →25Карточка →
Qwen3.8 27B
Alibaba (Qwen) · 1M токенов · от $0.45/1M
Gemini 3.7 Flash
Google · 1M токенов · от $0.38/1M
Grok 4.6
xAI · 500K токенов · от $2/1M
Qwen3.8 Max
Alibaba (Qwen) · 1M токенов · от $2/1M
Qwen3.7 Flash
Alibaba (Qwen) · 1M токенов · от $0.03/1M
Claude Opus 5 (Fast)
Anthropic · 1M токенов · от $10/1M
Claude Opus 5
Anthropic · 1M токенов · от $5/1M
Gemini 3.6 Flash
Google · 1M токенов · от $0.75/1M
Gemini 3.5 Flash-Lite
Google · 1M токенов · от $0.3/1M
GPT-5.6 Luna Pro
OpenAI · 1M токенов · от $0.2/1M
GPT-5.6 Luna
OpenAI · 1M токенов · от $0.2/1M
GPT-5.6 Terra Pro
OpenAI · 1M токенов · от $2/1M
GPT-5.6 Terra
OpenAI · 1M токенов · от $2/1M
GPT-5.6 Sol Pro
OpenAI · 1M токенов · от $2.5/1M
GPT-5.6 Sol
OpenAI · 1M токенов · от $2.5/1M
Grok 4.5
xAI · 500K токенов · от $2/1M
Claude Sonnet 5
Anthropic · 1M токенов · от $2/1M
Nano Banana 2 Lite (Gemini 3.1 Flash Lite Image)
Google · 66K токенов · от $0.25/1M
Nano Banana 2 (Gemini 3.1 Flash Image)
Google · 131K токенов · от $0.5/1M
Nano Banana Pro (Gemini 3 Pro Image)
Google · 131K токенов · от $2/1M
Claude Fable 5
Anthropic · 1M токенов · от $10/1M
Qwen3.7 Plus
Alibaba (Qwen) · 1M токенов · от $0.32/1M
Claude Opus 4.8 (Fast)
Anthropic · 1M токенов · от $10/1M
Claude Opus 4.8
Anthropic · 1M токенов · от $5/1M
Grok Build 0.1
xAI · 256K токенов · от $1/1M
Часто задаваемые вопросы
Какая нейросеть умеет анализировать картинки и PDF?
Флагманы GPT, Claude и Gemini принимают изображения и документы «из коробки». Среди открытых моделей мультимодальность есть у Qwen-VL и Llama Vision — они дешевле, но слабее на сложных документах.