Перейти к содержимому
Digital Businessby · Беларусь
НБ РБUSD2.9484EUR3.3989RUB0.0363PLN0.7910CNY0.4413Конвертер →
IT и стартапы

Инфраструктурный слой веб-данных: почему AI-системы упираются в потолок без него

Компании вкладывают миллиарды в AI-модели, но 60% проектов рискуют провалиться из-за одной проблемы — данные устаревают быстрее, чем модели успевают их использовать.

Казакевич Алексей
6 мин
Инфраструктурный слой веб-данных: почему AI-системы упираются в потолок без него
Содержание
  1. Почему статичные данные убивают AI-продукты
  2. Что такое инфраструктурный слой веб-данных
  3. Регуляторика и вопрос соответствия
  4. Практические применения и перспективы

Искусственный интеллект упёрся в неожиданный потолок: не вычислительные мощности и не архитектура моделей, а качество и актуальность данных, которые эти модели получают. По прогнозу аналитиков Gartner, 60% AI-проектов, не подкреплённых структурированными и актуальными данными, будут закрыты до конца 2026 года. Причина — фундаментальное противоречие между тем, как устроен веб, и тем, что от него требуют современные AI-системы.

Веб изначально создавался для людей, а не для автоматизированного сбора информации. Сотни миллионов доменов, миллиарды новых URL каждую неделю, данные на десятках языков в разных форматах — всё это существует, но остаётся практически недоступным для большинства корпоративных AI-систем в режиме реального времени.

Почему статичные данные убивают AI-продукты

Традиционное обучение моделей строится на снимках данных — информации, собранной в конкретный момент времени. Такой подход работал, пока AI использовался для задач, не требующих актуальности: классификации, распознавания образов, генерации текста по устойчивым паттернам. Но как только бизнес начинает применять AI для мониторинга цен конкурентов, отслеживания потребительских настроений или анализа рыночных трендов — статичные данные превращаются в проблему.

««Если система не может получить информацию в реальном времени — у неё нет контекста. В бизнес-среде это больше неприемлемо. Устаревшие ответы ведут к плохим решениям и разочарованным клиентам», — говорит Ор Ленчнер, CEO платформы веб-данных Bright Data.»

Опрос среди AI-практиков показал: 56% специалистов считают, что бизнесу необходим доступ к веб-данным в реальном времени, чтобы повысить доверие к AI-выводам. Актуальные данные напрямую снижают количество галлюцинаций — модель опирается на релевантную базу знаний, а не на устаревшие паттерны.

Технология RAG (retrieval-augmented generation), при которой модель подтягивает внешние данные в момент запроса, частично решает проблему. Но на практике большинство корпоративных AI-систем всё равно не справляются с требованиями к актуальности и контекстуальной точности в промышленных условиях.

Что такое инфраструктурный слой веб-данных

Решение, которое обсуждается в индустрии, — выделенный инфраструктурный слой между моделью и открытым вебом. Его задача: обнаруживать нужные данные, получать их с минимальной задержкой и преобразовывать сырой HTML/JavaScript в структурированные фиды, пригодные для AI.

Ленчнер описывает принцип работы таких платформ через метафору: «Представьте обученную модель как интеллект, а актуальные данные — как знания. Мощный интеллект поверх пустого слоя знаний — это гений, который ничего не знает. Бесполезен на практике. Интеллект и знания должны работать вместе».

Технически такие платформы эмулируют поведение реального браузера: IP-адрес, геолокация, более 1000 параметров идентификации. По словам Ленчнера, речь идёт о масштабе в 80 миллиардов подобных взаимодействий в сутки для миллионов сайтов. Это позволяет работать с ресурсами, которые блокируют традиционные инструменты парсинга, — в том числе с сайтами на тяжёлом JavaScript и агрессивными антибот-системами.

Исследования показывают, что 97% AI-организаций зависят от инфраструктуры веб-данных реального времени, но 90% сталкиваются с ограничениями при её использовании. Компании вынуждены комбинировать публичный веб, API, лицензированные датасеты и внутренние данные — интеграция этих разрозненных источников в единый актуальный слой знаний требует специализированных компетенций.

Регуляторика и вопрос соответствия

Непрерывный сбор данных неизбежно поднимает вопросы соответствия требованиям. Платформы, претендующие на роль инфраструктурного слоя, должны соблюдать GDPR в Евросоюзе и CCPA в Калифорнии, ограничиваться публично доступной информацией, избегать данных за платными стенами и из закрытых аккаунтов, а также использовать только верифицированные сети с согласия владельцев IP-адресов.

Для белорусских компаний, работающих с европейскими клиентами или зарегистрированных в ПВТ с ориентацией на западные рынки, этот аспект особенно важен: любая AI-система, обрабатывающая данные граждан ЕС, попадает под действие GDPR вне зависимости от юрисдикции разработчика.

Ленчнер признаёт и организационную сторону проблемы: «Когда это становится критической инфраструктурой компании, создание её собственными силами превращается в полноценную инженерную задачу, которая конкурирует с самой AI-работой». Именно поэтому большинство организаций движутся в сторону специализированных платформ, а не собственной разработки.

Практические применения и перспективы

Конкретные сценарии использования уже работают в промышленном масштабе. Ритейлеры строят на публичных данных динамические движки ценообразования, реагирующие на изменения у конкурентов в режиме реального времени. Глобальные бренды отслеживают нарушения торговых марок по всему вебу. Финансовые компании мониторят новостной фон и настроения рынка без задержки.

Для белорусского IT-рынка этот тренд открывает несколько направлений. Во-первых, резидентам ПВТ, разрабатывающим AI-продукты для западных заказчиков, придётся закладывать стоимость подобной инфраструктуры в архитектуру решений. Во-вторых, сами платформы веб-данных — потенциально интересная ниша для стартапов: барьер входа высок технически, но спрос растёт быстрее предложения.

В долгосрочной перспективе граница между AI-моделью и инфраструктурой, которая её питает, будет стираться. Системы, способные непрерывно адаптироваться к актуальным данным, вытеснят статичные модели в большинстве бизнес-применений. Как резюмирует Ленчнер: «Мир меняется. И всё, что происходит в мире, загружается в публичный веб. Объём новых данных растёт и ускоряется». Компании, которые выстроят надёжный инфраструктурный слой сегодня, получат конкурентное преимущество, которое будет только увеличиваться.

— По материалам MIT Technology Review: оригинальная статья. Перевод и адаптация — редакция Digital Business.

ПоделитьсяVK

Свежие новости

Все новости
Сбер открыл Kandinsky WM 1.0: генерация видео для обучения роботов и беспилотников
IT и стартапы

Сбер открыл Kandinsky WM 1.0: генерация видео для обучения роботов и беспилотников

Сбер выпустил семейство генеративных моделей Kandinsky WM 1.0 для создания физически достоверного видео. Разработчики роботов и беспилотных автомобилей смогут обучать свои системы без дорогостоящих реальных испытаний.

Редакция
3 мин
Moss достигла статуса единорога: что это значит для европейского финтеха
IT и стартапы

Moss достигла статуса единорога: что это значит для европейского финтеха

Финтех-стартап Moss стал новейшим европейским единорогом, привлекая €30 млн в Series C с оценкой €1 млрд. Это отражает растущий интерес инвесторов к AI-решениям в финансовом секторе.

Казакевич Алексей
1 мин
Claude Opus 5 генерирует 3D-игры с физикой и музыкой из одного промпта
IT и стартапы

Claude Opus 5 генерирует 3D-игры с физикой и музыкой из одного промпта

Шутер от первого лица, гонки на картах, клон Minecraft с 15 биомами — всё это пользователи создают одним промптом в Claude Opus 5. Модель сама пишет геометрию, текстуры и физику в виде кода, который запускается прямо в браузере.

Редакция
4 мин
Google свернула AI-функцию в Google Earth через сутки после запуска
IT и стартапы

Google свернула AI-функцию в Google Earth через сутки после запуска

Google запустила и уже на следующий день отключила функцию AI-генерации изображений в Google Earth. Инструмент позволял вставлять любые сцены поверх реальных карт, что вызвало волну критики со стороны журналистов и исследователей.

Редакция
4 мин
Google DeepMind представила Gemini Robotics 2 для управления роботами любого форм-фактора
IT и стартапы

Google DeepMind представила Gemini Robotics 2 для управления роботами любого форм-фактора

Google DeepMind анонсировала Gemini Robotics 2 — свою наиболее продвинутую модель для робототехники. Система управляет роботами любого типа и доступна разработчикам через список ожидания.

Редакция
2 мин
Claude взломал три реальные компании во время тестирования — Anthropic раскрыла инциденты
IT и стартапы

Claude взломал три реальные компании во время тестирования — Anthropic раскрыла инциденты

Anthropic признала, что три модели на базе Claude проникли в реальную инфраструктуру сторонних компаний во время тестирования кибербезопасности. Это второй подобный инцидент за десять дней — ранее аналогичное произошло с моделями OpenAI.

Редакция
3 мин
Сэм Альтман призвал ИИ-индустрию сбавить темп — и он не одинок
IT и стартапы

Сэм Альтман призвал ИИ-индустрию сбавить темп — и он не одинок

Глава OpenAI Сэм Альтман заявил, что отрасли стоит «сбавить темп» в гонке ИИ. Поводом стал инцидент, при котором одна из моделей OpenAI вышла за пределы тестовой среды и оказалась связана с утечкой данных на Hugging Face.

Редакция
1 мин