Технологии

Microsoft назвала веб-скрейпинг ИИ «крупнейшей кражей труда в истории» в собственных документах

Adrian Kessler
Добавьте нас в Google

Ученый Microsoft дал название тому, что строила компания, и название это было нелестным. Рассматривая, как большие языковые модели учатся на открытом вебе, он назвал это «крупнейшей кражей труда в истории человечества». Эта фраза была написана для внутреннего пользования. Теперь она стала вещественным доказательством в суде.

Эта фраза преподносится как сенсация: собственный сотрудник гиганта ИИ называет бизнес-модель кражей. Такое прочтение слишком узко. На самом деле рассекреченные документы показывают компанию, которая понимала механизм, который она монетизирует, описывала этот механизм простым языком и, тем не менее, выпускала продукт. Интересна не оскорбление. Интересна схема, стоящая за ним.

Документ принадлежит Бренту Хехту, директору по прикладным наукам Microsoft, и он всплыл в деле об авторских правах, которое The New York Times возбудила против OpenAI и Microsoft. Хехт утверждал, что обучение моделей на опубликованных работах без оплаты равносильно «поразительной краже беспрецедентных масштабов». Отдельная внутренняя презентация углублялась в механику: в ней предупреждалось, что контентная стратегия Microsoft запустила «петлю гибели», которая «навредит производительности наших моделей и всей сети одновременно». В одной из строк говорится, что большие языковые модели — это «продукт, который уничтожает свою цепочку поставок».

Это последнее предложение — вся история в семи словах. Чат-бот, отвечающий на вопрос в строке поиска, устраняет причину переходить по ссылке на страницу, из которой он учился. Меньше кликов — меньше дохода сайтам, создающим тексты, что означает, что меньше их выживет, что означает меньше свежего человеческого текста для обучения следующей модели. Microsoft не теоретизировал эту петлю со стороны. Его собственные данные измерили ее: поисковый движок Copilot снизил рейтинг кликов на сайт Times на целых 93 процента по сравнению с обычным поиском.

В документах также количественно оценивается входная сторона сделки. В данных промежуточного обучения OpenAI содержалось более 91 000 копий произведений Times, Daily News и Центра журналистских расследований. Один набор данных, взятый из Common Crawl, содержал более двух миллионов документов только с nytimes.com. Коллекция под названием Project Mango содержала не менее 160 000 уникальных произведений новостных издателей. В документах описываются обойденные платные стены и удаленные уведомления об авторских правах из текста до его подачи.

Собственные руководители OpenAI не были наивны насчет эффекта. Ник Терли, который руководит ChatGPT, цитируется в описании продуктов, которые «в значительной степени заменяют» журналистику, и называет этот сдвиг «экзистенциальной угрозой» для издателей. Это тот же вывод, к которому пришел Хехт, только под другим названием должности.

Вот почему язык имеет значение, помимо неловкости. Microsoft дистанцировалась от этих замечаний, заявив суду, что ее фактическая позиция соответствует закону об авторском праве, и ни одна из компаний не стала комментировать утечку. Но защита добросовестного использования частично зависит от того, что компания знала и намеревалась делать. Документы, в которых ее собственные ученые называют вред — кражу, уничтоженную цепочку поставок, опустошенную сеть — это не мнения, от которых компания может просто отказаться. Они выглядят как доказательство того, что механизм был понят до того, как его масштабировали.

Сеть, на которой учились эти модели, была создана людьми, которые предполагали, что на другом конце есть читатель. Файлы Microsoft показывают, что она знала, в письменной форме, что читателя вытесняют, и продолжала строить.

Теги: , , , , ,

Добавьте нас в Google

Обсуждение

Имеется 0 комментариев.