Перейти к содержимому
Экосистема AI Vibe
← Назад к AI Vibe News

Редакция 21 июля 2026 г.

Новости

Gemma 4 в Ollama 0.31 ускорили на 90% для кодинг-агентов на Mac

Черновая модель предлагает пакет токенов, а Gemma 4 в Ollama проверяет их за один проход на Mac.

В Ollama 0.31 Gemma 4 на Apple Silicon генерирует токены почти на 90% быстрее по бенчмарку Aider polyglot — ускорение включено по умолчанию и вывод модели не меняется. Ollama встроила multi-token prediction: рядом с основной моделью крутится маленький черновик, он предлагает несколько следующих токенов, а Gemma 4 проверяет пакет за один проход и оставляет только совпавшие.

Код предсказуемее обычного текста — закрывающие скобки, повторяющиеся идентификаторы, шаблонные куски — поэтому черновик чаще попадает в цель. Кодинг-агенты дергают модель непрерывно: читают файлы, гоняют тулы, идут по задаче шаг за шагом. Быстрее генерация — отзывчивее сессия. Замеры сняли на Gemma 4 12B (nvfp4) на M5 Max через реального агента, а не синтетический бенчмарк.

Как устроено

Сколько токенов черновить — зависит от квантизации, железа и самого текста в данный момент. Ollama подкручивает длину на лету по доле принятых предложений и времени проверки; когда спекуляция перестаёт помогать, движок снова декодирует по одному токену. Основная цена — в верификации пакета из 2–8 токенов: в MLX добавили ядро, которое читает блок весов один раз и переиспользует его по всему пакету. На M5 Max крупнейшие матричные умножения ускорились в 2–2,5 раза при той же математике.

Как запустить

Нужен Ollama 0.31 или новее на macOS. Если Gemma 4 скачивали раньше — подтяните сборку с MTP:

ollama pull gemma4:12b-mlx

Кодинг-агент через Claude:

ollama launch claude --model gemma4:12b-mlx

Тот же ollama launch работает с Codex, Droid, OpenCode, Copilot и другими агентами. Gemma 4 — первая модель с таким ускорением; для остальных обещают следующие релизы.

Источник: Faster Gemma 4 on MLX with multi-token prediction.