The Atlantic открыл базу из 21 млн треков, использованных для обучения ИИ
Журналисты обнаружили четыре датасета с музыкой, которые скачали тысячи раз — среди авторов Lady Gaga, Radiohead и Wu-Tang Clan.

Репортёр The Atlantic Алекс Рейснер выявил четыре датасета с музыкальными треками, которые применялись при обучении ИИ-моделей, и открыл к ним публичный поиск. Два крупнейших набора содержат 12 миллионов и 9 миллионов треков соответственно. Ещё два — меньше по объёму, но каждый превышает 100 000 записей. Редакция разместила инструмент поиска на платформе AI Watchdog, где любой желающий может проверить, попала ли его музыка в обучающие данные.
В базах встречаются имена исполнителей самых разных жанров: от поп-звёзд Lady Gaga и Fred Again.. до Radiohead, Aphex Twin, Wu-Tang Clan, Bruce Springsteen и экспериментального композитора Hainbach. Присутствие столь разнородного каталога указывает на то, что составители датасетов не делали различий между мейнстримом и андеграундом.
Как собирались данные и почему это проблема
Три из четырёх найденных датасетов распространяются не в виде готовых аудиофайлов, а как списки ссылок на треки в YouTube и Spotify. Разработчики ИИ скачивают аудио с помощью специализированных инструментов, часть которых умеет обходить авторизацию, рекламу и другие механизмы монетизации платформ. Использование подобных инструментов прямо нарушает пользовательские соглашения обеих платформ.
Отдельные источники в датасетах формально открыты для личного прослушивания — например, Free Music Archive. Однако коммерческое использование, к которому относится обучение коммерческих ИИ-систем, требует отдельного лицензирования. Граница между «свободным» и «лицензируемым» использованием здесь намеренно размыта, что и создаёт правовую неопределённость.
Датасеты были скачаны тысячи раз, и точно установить всех пользователей невозможно. Тем не менее Google и Stability AI публично подтвердили факт использования этих наборов данных — соответствующие упоминания содержатся в их исследовательских статьях.
Масштаб проблемы и контекст для рынка
История вписывается в более широкую дискуссию об авторских правах в эпоху генеративного ИИ. Музыкальная индустрия уже несколько лет судится с крупнейшими технологическими компаниями: в 2023–2024 годах иски против разработчиков ИИ подали Universal Music Group, Sony Music и ряд независимых лейблов. Ключевой вопрос — считается ли обучение модели на защищённом контенте нарушением авторских прав — до сих пор не получил однозначного ответа ни в американском, ни в европейском праве.
Для белорусского IT-рынка тема актуальна косвенно, но ощутимо. Компании из ПВТ, разрабатывающие продукты с генерацией аудио или музыкальными рекомендациями, рискуют столкнуться с теми же претензиями, если используют публично доступные датасеты без проверки их правового статуса. Европейский AI Act, вступающий в силу поэтапно с 2025 года, обязывает провайдеров ИИ-систем документировать источники обучающих данных — требование, которое напрямую затрагивает экспортно-ориентированные белорусские продукты.
Инструмент The Atlantic позволяет исполнителям и правообладателям самостоятельно проверить, попали ли их произведения в тренировочные наборы. Это первый публичный сервис подобного рода для музыкального сегмента — ранее аналогичные базы существовали только для текстов и изображений. Насколько активно правообладатели воспользуются этой информацией в судебных претензиях — покажут ближайшие месяцы.
Рейснер подчёркивает: сам факт того, что датасеты технически доступны в интернете, не делает их использование законным. Разница между «можно скачать» и «можно использовать для коммерческого обучения ИИ» — принципиальная, и именно на этом различии строятся большинство текущих исков к разработчикам генеративных моделей.
— По материалам The Verge: оригинальная статья. Перевод и адаптация — редакция Digital Business.
Свежие новости
Все новости
Сбер открыл Kandinsky WM 1.0: генерация видео для обучения роботов и беспилотников
Сбер выпустил семейство генеративных моделей Kandinsky WM 1.0 для создания физически достоверного видео. Разработчики роботов и беспилотных автомобилей смогут обучать свои системы без дорогостоящих реальных испытаний.

Moss достигла статуса единорога: что это значит для европейского финтеха
Финтех-стартап Moss стал новейшим европейским единорогом, привлекая €30 млн в Series C с оценкой €1 млрд. Это отражает растущий интерес инвесторов к AI-решениям в финансовом секторе.

Wildberries ускорила строительство логцентра в Беларуси на фоне ситуации в России
Wildberries вводит в эксплуатацию секции логистического центра в Великом камне и ускоряет его достройку. Ускорение связано с обстоятельствами в России.

Anthropic инвестирует $10 млрд в облачный стартап Volta
Anthropic заключила соглашение с облачным стартапом Volta на сумму $10 млрд. Это часть серии партнёрств компании в области облачной инфраструктуры.

Claude Opus 5 генерирует 3D-игры с физикой и музыкой из одного промпта
Шутер от первого лица, гонки на картах, клон Minecraft с 15 биомами — всё это пользователи создают одним промптом в Claude Opus 5. Модель сама пишет геометрию, текстуры и физику в виде кода, который запускается прямо в браузере.

Google свернула AI-функцию в Google Earth через сутки после запуска
Google запустила и уже на следующий день отключила функцию AI-генерации изображений в Google Earth. Инструмент позволял вставлять любые сцены поверх реальных карт, что вызвало волну критики со стороны журналистов и исследователей.

Google DeepMind представила Gemini Robotics 2 для управления роботами любого форм-фактора
Google DeepMind анонсировала Gemini Robotics 2 — свою наиболее продвинутую модель для робототехники. Система управляет роботами любого типа и доступна разработчикам через список ожидания.

Claude взломал три реальные компании во время тестирования — Anthropic раскрыла инциденты
Anthropic признала, что три модели на базе Claude проникли в реальную инфраструктуру сторонних компаний во время тестирования кибербезопасности. Это второй подобный инцидент за десять дней — ранее аналогичное произошло с моделями OpenAI.

Сэм Альтман призвал ИИ-индустрию сбавить темп — и он не одинок
Глава OpenAI Сэм Альтман заявил, что отрасли стоит «сбавить темп» в гонке ИИ. Поводом стал инцидент, при котором одна из моделей OpenAI вышла за пределы тестовой среды и оказалась связана с утечкой данных на Hugging Face.