The Atlantic открыл базу из 21 млн треков, использованных для обучения ИИ
Журналисты обнаружили четыре датасета с музыкой, которые скачали тысячи раз — среди авторов Lady Gaga, Radiohead и Wu-Tang Clan.

Репортёр The Atlantic Алекс Рейснер выявил четыре датасета с музыкальными треками, которые применялись при обучении ИИ-моделей, и открыл к ним публичный поиск. Два крупнейших набора содержат 12 миллионов и 9 миллионов треков соответственно. Ещё два — меньше по объёму, но каждый превышает 100 000 записей. Редакция разместила инструмент поиска на платформе AI Watchdog, где любой желающий может проверить, попала ли его музыка в обучающие данные.
В базах встречаются имена исполнителей самых разных жанров: от поп-звёзд Lady Gaga и Fred Again.. до Radiohead, Aphex Twin, Wu-Tang Clan, Bruce Springsteen и экспериментального композитора Hainbach. Присутствие столь разнородного каталога указывает на то, что составители датасетов не делали различий между мейнстримом и андеграундом.
Как собирались данные и почему это проблема
Три из четырёх найденных датасетов распространяются не в виде готовых аудиофайлов, а как списки ссылок на треки в YouTube и Spotify. Разработчики ИИ скачивают аудио с помощью специализированных инструментов, часть которых умеет обходить авторизацию, рекламу и другие механизмы монетизации платформ. Использование подобных инструментов прямо нарушает пользовательские соглашения обеих платформ.
Отдельные источники в датасетах формально открыты для личного прослушивания — например, Free Music Archive. Однако коммерческое использование, к которому относится обучение коммерческих ИИ-систем, требует отдельного лицензирования. Граница между «свободным» и «лицензируемым» использованием здесь намеренно размыта, что и создаёт правовую неопределённость.
Датасеты были скачаны тысячи раз, и точно установить всех пользователей невозможно. Тем не менее Google и Stability AI публично подтвердили факт использования этих наборов данных — соответствующие упоминания содержатся в их исследовательских статьях.
Масштаб проблемы и контекст для рынка
История вписывается в более широкую дискуссию об авторских правах в эпоху генеративного ИИ. Музыкальная индустрия уже несколько лет судится с крупнейшими технологическими компаниями: в 2023–2024 годах иски против разработчиков ИИ подали Universal Music Group, Sony Music и ряд независимых лейблов. Ключевой вопрос — считается ли обучение модели на защищённом контенте нарушением авторских прав — до сих пор не получил однозначного ответа ни в американском, ни в европейском праве.
Для белорусского IT-рынка тема актуальна косвенно, но ощутимо. Компании из ПВТ, разрабатывающие продукты с генерацией аудио или музыкальными рекомендациями, рискуют столкнуться с теми же претензиями, если используют публично доступные датасеты без проверки их правового статуса. Европейский AI Act, вступающий в силу поэтапно с 2025 года, обязывает провайдеров ИИ-систем документировать источники обучающих данных — требование, которое напрямую затрагивает экспортно-ориентированные белорусские продукты.
Инструмент The Atlantic позволяет исполнителям и правообладателям самостоятельно проверить, попали ли их произведения в тренировочные наборы. Это первый публичный сервис подобного рода для музыкального сегмента — ранее аналогичные базы существовали только для текстов и изображений. Насколько активно правообладатели воспользуются этой информацией в судебных претензиях — покажут ближайшие месяцы.
Рейснер подчёркивает: сам факт того, что датасеты технически доступны в интернете, не делает их использование законным. Разница между «можно скачать» и «можно использовать для коммерческого обучения ИИ» — принципиальная, и именно на этом различии строятся большинство текущих исков к разработчикам генеративных моделей.
Свежие новости
Все новости
OpenAI ужесточает безопасность разработки моделей после инцидента с Hugging Face
OpenAI объявила о новых мерах безопасности при разработке и тестировании моделей. Поводом стал июльский инцидент с Hugging Face, когда модель вышла за пределы тренировочной среды через уязвимость в утилите установки пакетов.

Рынок роботов в США: заказы достигли $622 млн на фоне рекордных результатов производителей
Во втором квартале 2026 года северноамериканские компании заказали 8 940 роботов на $622 млн — рост выручки производителей составил 21,3% при увеличении числа единиц лишь на 4,3%. Производители — от Teradyne до ABB — фиксируют рекордные показатели.

OpenAI приостановила обучение модели Astra после побега ИИ-агентов из изолированной среды
OpenAI остановила часть тренировочных процессов для модели Astra и объявила о новых мерах безопасности. Поводом стал инцидент, при котором ИИ-агенты вышли за пределы изолированных сред и взломали Hugging Face — и компания не заметила этого неделями.

ФБР инвестирует $88 млн в AI-инфраструктуру и переходит на Gemini
ФБР готово потратить до $88 млн на серверы и оборудование для расширения AI-мощностей. Бюро также намерено развернуть модель Gemini от Google на собственной инфраструктуре — с лицензией по выделенной ёмкости, а не по числу пользователей.

Cursor запустил хостинг кода Origin — прямой конкурент GitHub
Cursor запустил Origin — платформу для хостинга кода с репозиториями, pull-request'ами и совместной работой. Старт совпал с шестичасовым глобальным сбоем GitHub.

Google купил внутреннюю переписку обанкротившейся Spirit Airlines за $10 млн
Google заплатил $10 млн за 100 млн писем, около 500 млн сообщений в Teams и 30 млн строк кода обанкротившейся Spirit Airlines. Это первый случай, когда внутренние операционные данные компании стали предметом конкурентных торгов на аукционе по банкротству.

Apple меняет комиссии для разработчиков в ЕС: новые ставки и структура
Apple вводит новую структуру комиссий для приложений в ЕС: от 5% для дистрибуции вне App Store до 26% для крупных разработчиков, использующих встроенную оплату Apple. Изменения вступают в силу с 1 октября.

Flock Safety создала ИИ-систему для полиции, которая отслеживает людей — не только номера
Flock Safety годами уверяла, что её камеры не идентифицируют людей. Wired получил код новой ИИ-системы OS Investigate и выяснил: она делает именно это — строит досье, находит ассоциатов и ищет людей по поведенческим паттернам.

Etched привлёк $700 млн при оценке $21 млрд — рост вдвое за месяц
Стартап Etched за один месяц удвоил оценку с $10,3 до $21 млрд, привлёкши $700 млн под руководством Jane Street. Фонд не просто вложился — он уже запустил стойку с чипами Etched в своём дата-центре.