Технологии

Когда ИИ пишет и публикует код, опытные разработчики работают на 19% медленнее

Susan Hill

Программные агенты вроде Devin, Claude Code и GitHub Copilot Workspace теперь берут описание задачи, читают кодовую базу, пишут код, который её решает, выполняют тесты, пока те не пройдут, и открывают пул-реквест — без единой строки, набранной разработчиком. Devin, созданный Cognition AI, работает в изолированных облачных средах. Среди его пользователей 67% пул-реквестов, открытых им автономно, сливаются. Claude Code читает весь репозиторий, планирует изменения в нескольких файлах, запускает тестовый набор и итерирует без дополнительных инструкций между шагами. Эти инструменты используются в продакшене, а не в исследовательских превью.

Что отличает их от прежних инструментов генерации кода — это обратная связь. Механизм подсказок генерирует текст и останавливается; автономный агент генерирует код, запускает его, читает результат и пробует снова. Базовая структура одинакова для всех инструментов: большая языковая модель читает контекст — кодовую базу, описание задачи, журнал ошибок — генерирует план, выполняет его через такие инструменты, как команды оболочки, правки файлов и операции git, читает результат и вносит исправления. Цикл продолжается, пока агент не добьётся успеха или не исчерпает выделенные ресурсы.

Цикл, который заменил редактор

Диапазон автономности среди доступных инструментов делится на три уровня. На уровне ассистирования GitHub Copilot предлагает следующие несколько строк по мере того, как разработчик печатает. На один уровень выше — многофайловые редакторы вроде Cursor, которые переписывают код в кодовой базе по указанию разработчика, внося изменения, которые тот задаёт. На автономном уровне Devin и аналогичные системы работают независимо в течение длительного времени, принимая последовательные решения о том, что читать, что менять и что тестировать, и запрашивают одобрение только в тех случаях, с которыми система не может справиться сама.

Система оценки, измеряющая прогресс этих инструментов, — SWE-bench, созданная исследователями из Принстона и Стэнфорда. Она тестирует агентов на реальных отчётах об ошибках из открытых Python-репозиториев — Django, Flask, scikit-learn — и измеряет, какой процент ошибок агент может закрыть корректно. Текущий наивысший опубликованный результат на отобранном наборе Verified — 96% — принадлежит Claude Opus 5. Это число отражает реальную возможность: диагностировать настоящую программную ошибку, написать исправление и убедиться, что оно проходит собственные тесты проекта.

Что скрывает бенчмарк

Результат в 96% сопровождается важной оговоркой. SWE-bench Verified состоит из 500 тщательно отобранных задач. Когда исследователи применили устойчивый к загрязнению данных вариант — SWE-bench Pro, построенный на задачах, которые не могли появиться в обучающих данных ни одной модели, — более ранняя модель, набравшая более 80% на Verified, упала ниже 50% на Pro. Часть результатов бенчмарков объясняется знакомством с оценочным набором, а не обобщённой способностью решать задачи. Этот разрыв — известная исследовательская проблема, а не критика какого-то конкретного инструмента.

Отдельное исследование выявило нечто, что сложнее объяснить. METR, организация по исследованию безопасности ИИ, провела рандомизированное контролируемое исследование с участием опытных разработчиков открытого кода, работавших в собственных репозиториях. Разработчики, использующие современные ИИ-инструменты для кодирования, работали на 19% медленнее тех, кто работал без них — несмотря на то, что сами оценивали свою скорость как на 20% выше. Причины были конкретны: время, затраченное на перезапросы, когда агент выдавал неверные результаты; время на проверку результатов перед слиянием; и когнитивная нагрузка от переключения между управлением агентом и отслеживанием того, что он сделал. Бенчмарк проверяет, может ли агент закрыть чётко описанную ошибку изолированно. Рандомизированное исследование проверяет, работает ли разработчик быстрее в течение реального дня. Они измеряют разные вещи.

Почему 93% внедрения дали лишь 10% прироста пропускной способности

Кодовая автономность лучше всего работает на ограниченных, хорошо определённых задачах: воспроизводимая ошибка с чёткими входными и выходными данными, функция с точной спецификацией, тестовый набор для модуля с заданным поведением. Когда область расширяется до задач, требующих неявного архитектурного знания, недокументированных командных соглашений или решений о направлении продукта, надёжность падает — не потому, что моделям не хватает способностей, а потому что контекст, необходимый для таких решений, не помещается в систему и не может быть выведен только из файлов кодовой базы.

Практический сдвиг заключается в том, что теперь требуется от работы. Разработчики, работающие с автономными агентами, тратят больше времени на написание спецификаций, достаточно точных для выполнения агентом: подробные описания задач, чёткие контракты тестов, явные критерии приёмки. Они тратят больше времени на ревью кода, который не писали сами, — а это требует иного внимания, чем написание кода: поиск логических ошибок, пробелов в безопасности и архитектурного дрейфа, которые агент сам не заметит. Опрос 2026 года среди 121 000 разработчиков показал, что 93% регулярно используют ИИ-инструменты для кодирования; пропускная способность пул-реквестов в той же группе выросла примерно на 10%. Узкое место сместилось с написания кода на его ревью.

Следующий этап, который активно разрабатывается, — это агенты, управляющие собственными очередями задач: получая спецификацию проекта, разбивая её на подзадачи, распределяя между специализированными моделями и передавая на решение человеку только те решения, которые требуют его суждения. В 2026 году вышло несколько фреймворков с открытым исходным кодом для многолетней оркестрации кодирования. Корпоративное внедрение в производственных средах остаётся ограниченным. Gartner прогнозирует, что значительная часть агентных программных проектов, начатых в этом году, будет прекращена до 2028 года, когда команды обнаружат разрыв между тем, что показывает контролируемая демонстрация, и тем, что требуется для надёжного развёртывания в масштабе.

Теги: , , , ,

Обсуждение

Имеется 0 комментариев.