Agentic MapReduce: когда агенту нужен весь репозиторий, а не один модуль

Security-скан, поиск breaking changes или крупная миграция требуют, чтобы агент реально прошёлся по каждому файлу — а не остановился с уверенностью «я везде смотрел». Devin предложила Agentic MapReduce: модель один раз пишет селекторы релевантности, отбор кандидатов идёт детерминированно, разбор пачек — параллельными воркерами с узким контекстом.
У поискового агента на большом репозитории бюджет часто уходит на обход, а не на анализ. Zhang et al. на 300 траекториях Mini-SWE-Agent зафиксировали: чтение и поиск — 56.2% вызовов инструментов и 46.5% токенов главного агента.
Контекст тоже давит: при росте описания среды с 8K до 128K токенов точность Claude Opus 4.5 на LOCA-bench падает с 96.0% до 34.0%. Границы покрытия нет — Ko et al. нашли незакрытые критерии в 52.1% задач у поисковых агентов.
Четыре стадии конвейера
- Plan — агент изучает репозиторий и пишет селекторы: запросы Tree-sitter, обход графа импортов, сравнение API-схем.
- Shard — селекторы прогоняются детерминированно по всему репо; совпадения группируются в ограниченные пачки.
- Map — отдельная дочерняя сессия на пачку: воркер читает код вокруг сигнала и выдаёт структурированные находки.
- Reduce — агент дедуплицирует выводы воркеров, сводит приоритеты и ловит связи между шардами.
Скан завершён только когда конечная очередь исчерпана — не когда модель «решила, что достаточно». Селекторы сохраняются в репозитории; повторный прогон идёт по diff с последнего коммита.
Security Swarm на том же каркасе
Первый крупный кейс — Devin Security Swarm: пять стадий, включая Verify с песочницей на каждую серьёзную находку. На бенчмарке реальных CVE из GitHub Advisory Database — 72% recall за $90.23 за прогон. Claude Security даёт 68% за $131.87, Cursor Security — 26% за $4.60.
Источник: Agentic MapReduce.