Мультимодальные нейросети: модели с обработкой изображений и файлов
Модели, принимающие на вход не только текст: изображения, PDF и другие файлы. Подходят для анализа документов, распознавания и описания изображений, работы со скриншотами.
Обновлено: 4 октября 2026 · состав подборки обновляется автоматически по данным каталога
1Карточка →2Карточка →3Карточка →4Карточка →5Карточка →6Карточка →7Карточка →8Карточка →9Карточка →10Карточка →11Карточка →12Карточка →13Карточка →14Карточка →15Карточка →16Карточка →17Карточка →18Карточка →19Карточка →20Карточка →21Карточка →22Карточка →23Карточка →24Карточка →25Карточка →
GPT-6.1 Sol Pro
OpenAI · 1M токенов · от $2/1M
GPT-6.1 Sol
OpenAI · 1M токенов · от $2/1M
Claude Sonnet 5.5
Anthropic · 1M токенов · от $2/1M
Qwen3.8 Max Prime
Alibaba (Qwen) · 1M токенов · от $4/1M
GPT-6 Luna Pro
OpenAI · 1M токенов · от $0.1/1M
GPT-6 Luna
OpenAI · 1M токенов · от $0.1/1M
GPT-6 Sol Pro
OpenAI · 1M токенов · от $2/1M
GPT-6 Sol
OpenAI · 1M токенов · от $2/1M
Claude Opus 5.5
Anthropic · 1M токенов · от $4/1M
Grok 4.7
xAI · 500K токенов · от $2/1M
Qwen3.8 Omni Flash
Alibaba (Qwen) · 1M токенов · от $0.15/1M
DeepSeek V4.1 Flash
DeepSeek · 1M токенов · от $0.003/1M
GPT-6 Astra
OpenAI · 1M токенов · от $10/1M
GPT-6 Astra Pro
OpenAI · 1M токенов · от $10/1M
Qwen3.8 Max (0902)
Alibaba (Qwen) · 1M токенов · от $2/1M
Gemini 3.8 Flash
Google · 1M токенов · от $0.75/1M
Claude Fable 5.1
Anthropic · 1M токенов · от $10/1M
Qwen3.8 Flash
Alibaba (Qwen) · 1M токенов · от $0.15/1M
DeepSeek V4 Flash Vision Exp
DeepSeek · 1M токенов · от $0.22/1M
Qwen3.8 27B
Alibaba (Qwen) · 1M токенов · от $0.42/1M
Gemini 3.7 Flash
Google · 1M токенов · от $0.75/1M
Grok 4.6
xAI · 500K токенов · от $2/1M
Qwen3.7 Flash
Alibaba (Qwen) · 1M токенов · от $0.03/1M
Claude Opus 5
Anthropic · 1M токенов · от $5/1M
Gemini 3.6 Flash
Google · 1M токенов · от $0.75/1M
Часто задаваемые вопросы
Какая нейросеть умеет анализировать картинки и PDF?
Флагманы GPT, Claude и Gemini принимают изображения и документы «из коробки». Среди открытых моделей мультимодальность есть у Qwen-VL и Llama Vision — они дешевле, но слабее на сложных документах.