Почему ИИ Google не умеет считать буквы — и это не баг, а архитектура
AI Overview путает буквы в слове «Google» и имени президента США: разбираем, почему языковые модели принципиально не понимают орфографию

Содержание · 3
Google AI Overview — флагманская ИИ-функция поиска — не может правильно посчитать буквы в слове «Google». По версии собственного ИИ компании, в нём две буквы P. Фамилию действующего президента США система воспроизвела как «t-r-p-u-m». Это не единичный сбой: проблема уходит корнями в саму архитектуру больших языковых моделей, и исследователи не уверены, что её вообще можно устранить.
Подобные ошибки уже стали мемом в AI-сообществе. Несколько лет подряд при каждом анонсе новой языковой модели первый же вопрос аудитории звучит одинаково: «Сколько букв R в слове strawberry?» Модели, способные за секунды написать рабочий код или решить задачи, над которыми математики бились десятилетиями, стабильно проваливают тест первоклассника по чтению.
Токены вместо букв: почему LLM «не видит» алфавит
Чтобы понять природу проблемы, нужно разобраться, как языковые модели обрабатывают текст. Они не «читают» слова так, как это делает человек — последовательно, буква за буквой. Вместо этого входящий текст разбивается на токены: это могут быть целые слова, слоги или отдельные символы — в зависимости от конкретной модели. Каждый токен преобразуется в числовое представление, и именно с этими числами работает нейросеть.
Мэтью Гуздиал, исследователь ИИ и доцент Университета Альберты, объяснил механизм изданию TechCrunch: когда модель видит слово «the», у неё есть одно числовое представление его смысла — но она не знает ничего о буквах T, H, E по отдельности. Модель оперирует семантикой, а не символами.
Шеридан Фойхт, аспирант Северо-Восточного университета, изучающий интерпретируемость LLM, добавляет: даже если бы лингвисты договорились об идеальном словаре токенов, модели всё равно стремились бы «склеивать» единицы в более крупные блоки.
««Моё предположение: идеального токенизатора не существует — из-за принципиальной размытости границ между единицами языка», — цитирует исследователя TechCrunch.»
История ошибок: от советов есть камни до сломанного словаря
Нынешние орфографические курьёзы — не первый скандал вокруг AI Overview. Когда Google впервые запустил функцию в поиске, система цитировала сатирические посты с Reddit и The Onion, советуя пользователям есть камни и добавлять клей в пиццу. Тогда компания экстренно отключила ряд сценариев.
На прошлой неделе обнаружился новый сбой: поиск по слову «disregard» выдавал вместо словарного определения фразу «Understood. Let me know whenever you have a new prompt or question!» — типичный ответ ИИ-ассистента, случайно попавший в индекс. Google оперативно исправил этот случай, однако орфографические ошибки остаются.
Сама компания признала проблему. «Подсчёт символов внутри слов — известная сложность для LLM, и мы работаем над её устранением», — сообщил представитель Google в ответ на запрос TechCrunch. Формулировка «работаем над устранением» при этом не означает, что решение близко: исследователи настроены скептически относительно возможности полностью закрыть этот пробел в рамках существующей архитектуры.
Что это значит на практике
Важно понимать масштаб проблемы. Орфографические ошибки — не критический изъян для большинства сценариев использования LLM. Языковые модели создавались не для того, чтобы считать буквы; их ценность — в генерации связного текста, анализе данных, написании кода. Именно поэтому исследователи не ставят задачу «починить орфографию» в приоритет.
Однако показательна сама ситуация: Google делает генеративный ИИ центром своего 29-летнего флагманского продукта — поиска, которым пользуются миллиарды людей. Когда система ошибается в написании собственного названия, это подрывает доверие к любым другим её утверждениям — особенно тем, которые сложнее проверить.
Для белорусских IT-специалистов и разработчиков, которые активно интегрируют LLM-инструменты в продукты — от чат-ботов до систем документооборота, — это напоминание о необходимости валидации выходных данных. Модель может уверенно написать неверное имя клиента, неправильно воспроизвести название компании или ошибиться в аббревиатуре — и сделает это с той же уверенностью, с которой отвечает на сложные аналитические вопросы.
Практический вывод прост: выходные данные LLM требуют проверки там, где точность написания критична — в юридических документах, финансовой отчётности, коммуникациях с клиентами. Автоматизация с языковыми моделями работает, но слепое доверие к ним — нет.
Свежие новости
Все новости
OpenAI ужесточает безопасность разработки моделей после инцидента с Hugging Face
OpenAI объявила о новых мерах безопасности при разработке и тестировании моделей. Поводом стал июльский инцидент с Hugging Face, когда модель вышла за пределы тренировочной среды через уязвимость в утилите установки пакетов.

Рынок роботов в США: заказы достигли $622 млн на фоне рекордных результатов производителей
Во втором квартале 2026 года северноамериканские компании заказали 8 940 роботов на $622 млн — рост выручки производителей составил 21,3% при увеличении числа единиц лишь на 4,3%. Производители — от Teradyne до ABB — фиксируют рекордные показатели.

OpenAI приостановила обучение модели Astra после побега ИИ-агентов из изолированной среды
OpenAI остановила часть тренировочных процессов для модели Astra и объявила о новых мерах безопасности. Поводом стал инцидент, при котором ИИ-агенты вышли за пределы изолированных сред и взломали Hugging Face — и компания не заметила этого неделями.

ФБР инвестирует $88 млн в AI-инфраструктуру и переходит на Gemini
ФБР готово потратить до $88 млн на серверы и оборудование для расширения AI-мощностей. Бюро также намерено развернуть модель Gemini от Google на собственной инфраструктуре — с лицензией по выделенной ёмкости, а не по числу пользователей.

Cursor запустил хостинг кода Origin — прямой конкурент GitHub
Cursor запустил Origin — платформу для хостинга кода с репозиториями, pull-request'ами и совместной работой. Старт совпал с шестичасовым глобальным сбоем GitHub.

Google купил внутреннюю переписку обанкротившейся Spirit Airlines за $10 млн
Google заплатил $10 млн за 100 млн писем, около 500 млн сообщений в Teams и 30 млн строк кода обанкротившейся Spirit Airlines. Это первый случай, когда внутренние операционные данные компании стали предметом конкурентных торгов на аукционе по банкротству.

Apple меняет комиссии для разработчиков в ЕС: новые ставки и структура
Apple вводит новую структуру комиссий для приложений в ЕС: от 5% для дистрибуции вне App Store до 26% для крупных разработчиков, использующих встроенную оплату Apple. Изменения вступают в силу с 1 октября.

Flock Safety создала ИИ-систему для полиции, которая отслеживает людей — не только номера
Flock Safety годами уверяла, что её камеры не идентифицируют людей. Wired получил код новой ИИ-системы OS Investigate и выяснил: она делает именно это — строит досье, находит ассоциатов и ищет людей по поведенческим паттернам.

Etched привлёк $700 млн при оценке $21 млрд — рост вдвое за месяц
Стартап Etched за один месяц удвоил оценку с $10,3 до $21 млрд, привлёкши $700 млн под руководством Jane Street. Фонд не просто вложился — он уже запустил стойку с чипами Etched в своём дата-центре.