Технологии

Anthropic раскрыла данные: Claude ведёт 26% собственных AI-исследований — и сам их оценивает

Adrian Kessler
Добавьте нас в Google

Каждая четвертая исследовательская задача в области ИИ в Anthropic теперь ведется Claude. Не поручена Клоду в качестве помощника, не проверена Клодом задним числом — запускается с общего запроса и выполняется от начала до конца, а человек проверяет результат после завершения. Девять месяцев назад этот показатель составлял менее одного процента.

Anthropic проводит различие между двумя категориями. Когда Claude ведет задачу, он выполняет большую часть работы самостоятельно; руководитель проверяет результат, а не направляет каждый шаг. Это иная категория, нежели те девяносто процентов всех исследований и разработок Anthropic, где Claude выступает в роли соавтора — человек управляет процессом, а Claude выполняет отдельные части. Категория «ведет» — более строгая. Сейчас на нее приходится 26 процентов всех исследовательских работ компании в области ИИ, с поправкой на время, которое исследователи в противном случае тратили бы на эти задачи.

Масштаб конкретен. Около 30 000 агентов Claude одновременно работают на внутренних платформах Anthropic, выполняя задачи по обучению моделей, оценке, исследованиям интерпретируемости и анализу безопасности. В августе эти агенты приняли в общей сложности более миллиарда решений. Системы мониторинга в реальном времени Anthropic заблокировали 0,002 процента из них — примерно одно из каждых 47 000 действий — до выполнения. Затем офлайн-уровень еженедельно помечал около 100 000 транскриптов для проверки, передавая человеку примерно 50 из них.

Безопасность имеет измеримый бюджет внутри этой системы. В течение одной недели в июле работа, направленная на обеспечение безопасности агентов, потребляла шесть процентов всех вычислительных мощностей исследований и разработок в области ИИ и двенадцать процентов вычислительных мощностей, используемых самими ИИ-исследованиями. Anthropic заявляет, что классифицировала консервативно, исключив из подсчета специализированные классификаторы безопасности, что указывает на то, что истинная доля может быть еще выше.

В центре всего этого лежит эпистемологическая проблема. Вклад Claude в исследования Anthropic частично оценивается самим Claude. Модель Claude оценивает работу Claude; показатели контроля охватывают только одну внутреннюю платформу; а классификация вычислительных мощностей основывалась на том, что модели Claude сами отбирали и маркировали свои прогоны. Ни одна независимая третья сторона не проверяла методологию. Три опубликованных Anthropic числа точны, но это самоотчетная точность — а это не то же самое, что подтвержденная точность.

Anthropic заявляет, что начнет встраивать внешних оценщиков в процесс. Ни имен, ни дат начала, ни сопоставимых раскрытий от других лабораторий ИИ пока не появилось. Показатель в 26 процентов, учитывая темпы его роста, является скорее моментальным снимком, чем потолком.

Теги: , , , , ,

Добавьте нас в Google

Обсуждение

Имеется 0 комментариев.