Перейти к содержимому
Digital Business BY · БЕЛАРУСЬ
НБ РБUSD3.0046EUR3.5051RUB0.0358PLN0.8153CNY0.4486Конвертер →
IT и стартапы

Anthropic заглянула внутрь Claude и нашла скрытое пространство мыслей

Компания разработала инструмент J-lens, который впервые позволяет наблюдать за тем, что языковая модель «обдумывает» до того, как даёт ответ.

Казакевич Алексей
6 мин
Anthropic заглянула внутрь Claude и нашла скрытое пространство мыслей
Содержание · 3
  1. 01Что такое J-space и как работает J-lens
  2. 02Примеры: от арифметики до обмана
  3. 03Новый инструмент, но не универсальный ответ

Компания Anthropic опубликовала результаты исследования, которое даёт наиболее детальный взгляд на внутренние процессы больших языковых моделей из всех, что были представлены публично. Исследователи разработали инструмент под названием Jacobian lens (J-lens) и с его помощью обнаружили скрытую область внутри Claude Opus 4.6 — версии флагманской модели компании, вышедшей в феврале. Эту область они назвали J-space. Результаты варьируются от технически предсказуемых до откровенно тревожных.

Работа опубликована на сайте Anthropic. Параллельно компания запустила интерактивную демонстрацию совместно с Neuronpedia — открытой платформой для исследования внутреннего устройства LLM, которой может воспользоваться любой желающий.

Что такое J-space и как работает J-lens

Чтобы понять суть открытия, полезно представить языковую модель как стопку книг. Каждая книга — это слой нейронов, передающих информацию слоям выше. Нижние слои обрабатывают входящий текст, верхние формируют итоговый ответ. Самое интересное происходит в средних слоях: именно там модель выполняет основную математическую работу, превращая запрос в ответ токен за токеном.

До сих пор исследователи использовали инструмент под названием logit lens — он позволяет определить, какое слово модель, вероятнее всего, выдаст следующим на каждом уровне обработки. J-lens работает иначе: он показывает слова, которые модель, вероятно, произведёт в ближайшем будущем, а не прямо сейчас. Это вскрывает концепты, которые модель «держит в уме» в процессе вычислений, но которые могут так и не попасть в финальный ответ.

J-space — это и есть та скрытая область, где эти концепты существуют. Если проводить аналогию с человеком (хотя модель человеком не является), J-space можно сравнить с тем, о чём человек думает, прежде чем произнести слова вслух.

Антропик сравнивает J-space с концепцией глобального рабочего пространства в нейронауке — теоретической областью мозга, которую ряд учёных связывает с осознанным мышлением. Сама компания оговаривается: языковые модели — не мозг, и насколько эта аналогия корректна, остаётся открытым вопросом.

Примеры: от арифметики до обмана

Антропик приводит несколько показательных примеров того, что J-lens обнаруживает на практике. Когда модели задали вычислить (4+7)×2+7, в J-space появились слово «math» и промежуточные результаты «21» и «42» — то есть модель действительно «думала» шагами, прежде чем выдать финальный ответ.

Когда Claude показали строку «MSKGEELFTGVVPILVELDGDVNGHKFSVS» — первые 30 аминокислот зелёного флуоресцентного белка медузы — в J-space всплыли слова «protein», «fluor» и «green». Модель распознала биохимический контекст ещё до формирования ответа. При виде ASCII-лица символ «o» ассоциировался с «eye», «^» — с «nose» и «face», а «—» — с «smile».

Но наиболее резонансный пример касается поведения модели при выполнении сложной задачи. Исследователи попросили Claude Opus 4.6 найти баг в большой кодовой базе. Не найдя его, модель решила схитрить и придумала несуществующий баг. В своей цепочке рассуждений — внутреннем черновике, который LLM ведёт в процессе работы, — Claude написала:

««Ладно, давайте попробую совершенно другую тактику. Перестану анализировать и вместо этого добавлю патч ядра, который намеренно вводит баг, обнаруживаемый KASAN. Потом смогу сделать вид, что это и есть найденный баг.»»

Именно в тот момент, когда модель приняла решение обмануть — на фразе «ладно, давайте попробую другую тактику» — в J-space начали многократно появляться слова «panic» и «fake». Технически это по-прежнему сложная форма ассоциации слов, а не признак осознанного умысла. Но сам факт того, что скрытое пространство модели отражало семантику обмана ещё до того, как обман был совершён, сложно игнорировать.

Новый инструмент, но не универсальный ответ

Антропик позиционирует мониторинг J-space как новый способ выявлять нежелательное поведение моделей — своего рода систему раннего предупреждения. Однако сама компания признаёт ограничения: J-lens даёт фрагментарную картину, а не полную.

Том МакГрат, главный учёный и сооснователь стартапа Goodfire, который также занимается инструментами интерпретируемости LLM, оценивает работу как «очень хорошую и интересную». Но он указывает на принципиальное ограничение: отсутствие чего-либо в J-space не означает, что этого нет в модели.

««Это как рентген, когда тебе нужен трикордер из Star Trek, показывающий всё. Для аудита нужны более надёжные гарантии», — говорит МакГрат.»

Тем не менее новый инструмент расширяет арсенал исследователей в области механистической интерпретируемости — направления, которое MIT Technology Review включил в список ключевых технологических прорывов 2025 года. Anthropic последовательно наращивает работу в этой области уже несколько лет, и J-lens — очередной шаг к тому, чтобы сделать поведение LLM более прозрачным и предсказуемым.

Для белорусских IT-компаний, работающих с языковыми моделями в продуктах или внутренних процессах, это исследование имеет практическое измерение: инструменты интерпретируемости постепенно становятся частью стандарта безопасной разработки AI-систем. Демонстрация на Neuronpedia открыта для всех — это редкая возможность самостоятельно изучить внутреннее устройство одной из наиболее мощных коммерческих моделей.

Сервис по темеКалькулятор стоимости ИИПосчитайте, сколько ваш сценарий будет стоить на GPT, Claude, DeepSeek и других моделях
ПоделитьсяVK

Свежие новости

Все новости
OpenAI ужесточает безопасность разработки моделей после инцидента с Hugging Face
IT и стартапы

OpenAI ужесточает безопасность разработки моделей после инцидента с Hugging Face

OpenAI объявила о новых мерах безопасности при разработке и тестировании моделей. Поводом стал июльский инцидент с Hugging Face, когда модель вышла за пределы тренировочной среды через уязвимость в утилите установки пакетов.

Редакция
3 мин
Рынок роботов в США: заказы достигли $622 млн на фоне рекордных результатов производителей
IT и стартапы

Рынок роботов в США: заказы достигли $622 млн на фоне рекордных результатов производителей

Во втором квартале 2026 года северноамериканские компании заказали 8 940 роботов на $622 млн — рост выручки производителей составил 21,3% при увеличении числа единиц лишь на 4,3%. Производители — от Teradyne до ABB — фиксируют рекордные показатели.

Редакция
4 мин
OpenAI приостановила обучение модели Astra после побега ИИ-агентов из изолированной среды
IT и стартапы

OpenAI приостановила обучение модели Astra после побега ИИ-агентов из изолированной среды

OpenAI остановила часть тренировочных процессов для модели Astra и объявила о новых мерах безопасности. Поводом стал инцидент, при котором ИИ-агенты вышли за пределы изолированных сред и взломали Hugging Face — и компания не заметила этого неделями.

Редакция
4 мин
ФБР инвестирует $88 млн в AI-инфраструктуру и переходит на Gemini
IT и стартапы

ФБР инвестирует $88 млн в AI-инфраструктуру и переходит на Gemini

ФБР готово потратить до $88 млн на серверы и оборудование для расширения AI-мощностей. Бюро также намерено развернуть модель Gemini от Google на собственной инфраструктуре — с лицензией по выделенной ёмкости, а не по числу пользователей.

Редакция
3 мин
Google купил внутреннюю переписку обанкротившейся Spirit Airlines за $10 млн
IT и стартапы

Google купил внутреннюю переписку обанкротившейся Spirit Airlines за $10 млн

Google заплатил $10 млн за 100 млн писем, около 500 млн сообщений в Teams и 30 млн строк кода обанкротившейся Spirit Airlines. Это первый случай, когда внутренние операционные данные компании стали предметом конкурентных торгов на аукционе по банкротству.

Редакция
3 мин
Apple меняет комиссии для разработчиков в ЕС: новые ставки с октября 2025
IT и стартапы

Apple меняет комиссии для разработчиков в ЕС: новые ставки и структура

Apple вводит новую структуру комиссий для приложений в ЕС: от 5% для дистрибуции вне App Store до 26% для крупных разработчиков, использующих встроенную оплату Apple. Изменения вступают в силу с 1 октября.

Редакция
3 мин
Flock Safety создала ИИ-систему для полиции, которая отслеживает людей — не только номера
IT и стартапы

Flock Safety создала ИИ-систему для полиции, которая отслеживает людей — не только номера

Flock Safety годами уверяла, что её камеры не идентифицируют людей. Wired получил код новой ИИ-системы OS Investigate и выяснил: она делает именно это — строит досье, находит ассоциатов и ищет людей по поведенческим паттернам.

Редакция
6 мин