Перейти к содержимому
Digital Business BY · БЕЛАРУСЬ
НБ РБUSD3.0316EUR3.4487RUB0.0358PLN0.7861CNY0.4531Конвертер →
IT и стартапы

Инфраструктурный слой веб-данных: почему AI-системы упираются в потолок без него

Компании вкладывают миллиарды в AI-модели, но 60% проектов рискуют провалиться из-за одной проблемы — данные устаревают быстрее, чем модели успевают их использовать.

Казакевич Алексей
6 мин
Инфраструктурный слой веб-данных: почему AI-системы упираются в потолок без него
Содержание · 4
  1. 01Почему статичные данные убивают AI-продукты
  2. 02Что такое инфраструктурный слой веб-данных
  3. 03Регуляторика и вопрос соответствия
  4. 04Практические применения и перспективы

Искусственный интеллект упёрся в неожиданный потолок: не вычислительные мощности и не архитектура моделей, а качество и актуальность данных, которые эти модели получают. По прогнозу аналитиков Gartner, 60% AI-проектов, не подкреплённых структурированными и актуальными данными, будут закрыты до конца 2026 года. Причина — фундаментальное противоречие между тем, как устроен веб, и тем, что от него требуют современные AI-системы.

Веб изначально создавался для людей, а не для автоматизированного сбора информации. Сотни миллионов доменов, миллиарды новых URL каждую неделю, данные на десятках языков в разных форматах — всё это существует, но остаётся практически недоступным для большинства корпоративных AI-систем в режиме реального времени.

Почему статичные данные убивают AI-продукты

Традиционное обучение моделей строится на снимках данных — информации, собранной в конкретный момент времени. Такой подход работал, пока AI использовался для задач, не требующих актуальности: классификации, распознавания образов, генерации текста по устойчивым паттернам. Но как только бизнес начинает применять AI для мониторинга цен конкурентов, отслеживания потребительских настроений или анализа рыночных трендов — статичные данные превращаются в проблему.

««Если система не может получить информацию в реальном времени — у неё нет контекста. В бизнес-среде это больше неприемлемо. Устаревшие ответы ведут к плохим решениям и разочарованным клиентам», — говорит Ор Ленчнер, CEO платформы веб-данных Bright Data.»

Опрос среди AI-практиков показал: 56% специалистов считают, что бизнесу необходим доступ к веб-данным в реальном времени, чтобы повысить доверие к AI-выводам. Актуальные данные напрямую снижают количество галлюцинаций — модель опирается на релевантную базу знаний, а не на устаревшие паттерны.

Технология RAG (retrieval-augmented generation), при которой модель подтягивает внешние данные в момент запроса, частично решает проблему. Но на практике большинство корпоративных AI-систем всё равно не справляются с требованиями к актуальности и контекстуальной точности в промышленных условиях.

Что такое инфраструктурный слой веб-данных

Решение, которое обсуждается в индустрии, — выделенный инфраструктурный слой между моделью и открытым вебом. Его задача: обнаруживать нужные данные, получать их с минимальной задержкой и преобразовывать сырой HTML/JavaScript в структурированные фиды, пригодные для AI.

Ленчнер описывает принцип работы таких платформ через метафору: «Представьте обученную модель как интеллект, а актуальные данные — как знания. Мощный интеллект поверх пустого слоя знаний — это гений, который ничего не знает. Бесполезен на практике. Интеллект и знания должны работать вместе».

Технически такие платформы эмулируют поведение реального браузера: IP-адрес, геолокация, более 1000 параметров идентификации. По словам Ленчнера, речь идёт о масштабе в 80 миллиардов подобных взаимодействий в сутки для миллионов сайтов. Это позволяет работать с ресурсами, которые блокируют традиционные инструменты парсинга, — в том числе с сайтами на тяжёлом JavaScript и агрессивными антибот-системами.

Исследования показывают, что 97% AI-организаций зависят от инфраструктуры веб-данных реального времени, но 90% сталкиваются с ограничениями при её использовании. Компании вынуждены комбинировать публичный веб, API, лицензированные датасеты и внутренние данные — интеграция этих разрозненных источников в единый актуальный слой знаний требует специализированных компетенций.

Регуляторика и вопрос соответствия

Непрерывный сбор данных неизбежно поднимает вопросы соответствия требованиям. Платформы, претендующие на роль инфраструктурного слоя, должны соблюдать GDPR в Евросоюзе и CCPA в Калифорнии, ограничиваться публично доступной информацией, избегать данных за платными стенами и из закрытых аккаунтов, а также использовать только верифицированные сети с согласия владельцев IP-адресов.

Для белорусских компаний, работающих с европейскими клиентами или зарегистрированных в ПВТ с ориентацией на западные рынки, этот аспект особенно важен: любая AI-система, обрабатывающая данные граждан ЕС, попадает под действие GDPR вне зависимости от юрисдикции разработчика.

Ленчнер признаёт и организационную сторону проблемы: «Когда это становится критической инфраструктурой компании, создание её собственными силами превращается в полноценную инженерную задачу, которая конкурирует с самой AI-работой». Именно поэтому большинство организаций движутся в сторону специализированных платформ, а не собственной разработки.

Практические применения и перспективы

Конкретные сценарии использования уже работают в промышленном масштабе. Ритейлеры строят на публичных данных динамические движки ценообразования, реагирующие на изменения у конкурентов в режиме реального времени. Глобальные бренды отслеживают нарушения торговых марок по всему вебу. Финансовые компании мониторят новостной фон и настроения рынка без задержки.

Для белорусского IT-рынка этот тренд открывает несколько направлений. Во-первых, резидентам ПВТ, разрабатывающим AI-продукты для западных заказчиков, придётся закладывать стоимость подобной инфраструктуры в архитектуру решений. Во-вторых, сами платформы веб-данных — потенциально интересная ниша для стартапов: барьер входа высок технически, но спрос растёт быстрее предложения.

В долгосрочной перспективе граница между AI-моделью и инфраструктурой, которая её питает, будет стираться. Системы, способные непрерывно адаптироваться к актуальным данным, вытеснят статичные модели в большинстве бизнес-применений. Как резюмирует Ленчнер: «Мир меняется. И всё, что происходит в мире, загружается в публичный веб. Объём новых данных растёт и ускоряется». Компании, которые выстроят надёжный инфраструктурный слой сегодня, получат конкурентное преимущество, которое будет только увеличиваться.

ПоделитьсяVK

Свежие новости

Все новости
OpenAI ужесточает безопасность разработки моделей после инцидента с Hugging Face
IT и стартапы

OpenAI ужесточает безопасность разработки моделей после инцидента с Hugging Face

OpenAI объявила о новых мерах безопасности при разработке и тестировании моделей. Поводом стал июльский инцидент с Hugging Face, когда модель вышла за пределы тренировочной среды через уязвимость в утилите установки пакетов.

Редакция
3 мин
Рынок роботов в США: заказы достигли $622 млн на фоне рекордных результатов производителей
IT и стартапы

Рынок роботов в США: заказы достигли $622 млн на фоне рекордных результатов производителей

Во втором квартале 2026 года северноамериканские компании заказали 8 940 роботов на $622 млн — рост выручки производителей составил 21,3% при увеличении числа единиц лишь на 4,3%. Производители — от Teradyne до ABB — фиксируют рекордные показатели.

Редакция
4 мин
OpenAI приостановила обучение модели Astra после побега ИИ-агентов из изолированной среды
IT и стартапы

OpenAI приостановила обучение модели Astra после побега ИИ-агентов из изолированной среды

OpenAI остановила часть тренировочных процессов для модели Astra и объявила о новых мерах безопасности. Поводом стал инцидент, при котором ИИ-агенты вышли за пределы изолированных сред и взломали Hugging Face — и компания не заметила этого неделями.

Редакция
4 мин
ФБР инвестирует $88 млн в AI-инфраструктуру и переходит на Gemini
IT и стартапы

ФБР инвестирует $88 млн в AI-инфраструктуру и переходит на Gemini

ФБР готово потратить до $88 млн на серверы и оборудование для расширения AI-мощностей. Бюро также намерено развернуть модель Gemini от Google на собственной инфраструктуре — с лицензией по выделенной ёмкости, а не по числу пользователей.

Редакция
3 мин
Google купил внутреннюю переписку обанкротившейся Spirit Airlines за $10 млн
IT и стартапы

Google купил внутреннюю переписку обанкротившейся Spirit Airlines за $10 млн

Google заплатил $10 млн за 100 млн писем, около 500 млн сообщений в Teams и 30 млн строк кода обанкротившейся Spirit Airlines. Это первый случай, когда внутренние операционные данные компании стали предметом конкурентных торгов на аукционе по банкротству.

Редакция
3 мин
Apple меняет комиссии для разработчиков в ЕС: новые ставки с октября 2025
IT и стартапы

Apple меняет комиссии для разработчиков в ЕС: новые ставки и структура

Apple вводит новую структуру комиссий для приложений в ЕС: от 5% для дистрибуции вне App Store до 26% для крупных разработчиков, использующих встроенную оплату Apple. Изменения вступают в силу с 1 октября.

Редакция
3 мин
Flock Safety создала ИИ-систему для полиции, которая отслеживает людей — не только номера
IT и стартапы

Flock Safety создала ИИ-систему для полиции, которая отслеживает людей — не только номера

Flock Safety годами уверяла, что её камеры не идентифицируют людей. Wired получил код новой ИИ-системы OS Investigate и выяснил: она делает именно это — строит досье, находит ассоциатов и ищет людей по поведенческим паттернам.

Редакция
6 мин