Перейти к содержимому
Экосистема AI Vibe
← Назад к AI Vibe News

Редакция 6 января 2025 г.

Обновлено 21 июля 2026

Новости

49% на SWE-bench: минимальный агент с bash и редактором

Агент в терминале чинит Python-репозиторий — bash-команды и точечные правки файлов по описанию issue.

Обновлённый Claude 3.5 Sonnet набрал 49% на SWE-bench Verified — на 4 п.п. выше прежнего рекорда. Anthropic разобрала, как устроен агент вокруг модели: не тест «в вакууме», а связка с промптом, разбором ответов и циклом действий.

Минимальный каркас

Максимум контроля у модели, минимум жёсткой обвязки. Промпт намечает шаги — изучить репозиторий, воспроизвести баг, поправить код, перепроверить — но фиксированного конвейера нет. Цикл крутится, пока модель не решит, что задача закрыта, или пока не упрётся в лимит контекста 200k токенов.

Два инструмента

  • Bash Tool — shell-команды; в описании прописаны ограничения: без интернета, зеркала apt и pip, подсказки по фоновым процессам.
  • Edit Tool (str_replace_editor) — просмотр, создание и правка файлов; замена через old_str и new_str срабатывает только при единственном совпадении.

Пути к файлам сделали только абсолютными — относительные часто ломались после смены рабочей директории. Описания тулов тестировали на типичных ошибках понимания; авторы сравнивают это с проектированием интерфейсов для людей.

На бенчмарке агент получает Python-окружение и снимок кода до фикса GitHub issue из open-source репозиториев; успех сверяют с юнит-тестами из оригинального pull request. Подвыборка Verified — 500 задач, которые люди вручную проверили на решаемость. Код собирали на базе SWE-Agent: на той же обвязке старый Claude 3.5 Sonnet давал 33%, Claude 3 Opus — 22%; до отметки в 50% пока никто не дошёл.

Источник: Raising the bar on SWE-bench Verified with Claude 3.5 Sonnet.