От переписок до записей совещаний: ИИ-гигантам нужны внутренние документы компаний — общедоступный контент для обучения закончился

Разработчики ИИ, включая OpenAI и Anthropic, столкнулись с исчерпанием качественного контента в открытом интернете и переключили свое внимание на внутренние корпоративные данные. Сейчас компании активно скупают логи мессенджеров, электронную переписку, записи видеоконференций и историю изменений программного кода, так как именно в них зафиксированы реальные процессы решения задач, обсуждения финансовых показателей и профессиональные коммуникации.
По данным брокера данных Protege, объем сделок в этой сфере вырос с 30 миллионов долларов в прошлом году до 100 миллионов в нынешнем. Особым спросом пользуются данные стартапов, находящихся на грани банкротства или поглощения: например, стартап Warmly получил предложения на покупку рабочих архивов на сумму до 300 тысяч долларов.
Рост рынка делает вопрос защиты конфиденциальности крайне острым. Компании-посредники утверждают, что внедряют строгие процессы анонимизации, чтобы удалять информацию, позволяющую идентифицировать сотрудников, сохраняя при этом ценность данных для обучения нейросетей.