Перейти к содержимому
Экосистема AI Vibe
← Назад к AI Vibe News

Редакция 11 июня 2026 г.

Обновлено 21 июля 2026

Новости

Ollama на Mac: MLX быстрее на 20% и снимки состояния для кодинг-агентов

Кодинг-агент на MacBook с Ollama крутит локальную Gemma 4 через MLX, пока субагенты делят общий контекст без повторной обработки.

Ollama обновила MLX-движок на Apple Silicon: вывод быстрее до 20%, квантование NVFP4 точнее привычного 4-битного формата, а снимки состояния модели снимают лишнюю работу в агентских сессиях. На демо — кодинг-агент с Gemma 4 12B на MacBook Pro M5 Max, несколько субагентов и режим рассуждения.

Качество и скорость

NVFP4 точнее отслеживает динамический диапазон весов. Для Gemma 4 12B разрыв perplexity с несжатыми bf16 примерно вдвое меньше, чем у q4_K_M. Модели, заточенные под датацентр, можно импортировать и гонять локально на том же движке.

Часть операций слили в Metal-ядра через JIT-компилятор MLX, переделали GPU-сэмплинг. На промпте в 8 300 токенов NVFP4 выдаёт примерно на 20% больше токенов в секунду, чем q4_K_M — среднее за 10 прогонов.

Снимки для агентов

В агентском workflow главная нагрузка — обработка промпта. Каждый вызов инструмента шлёт заново системный промпт, описания инструментов и все прочитанные файлы. Prefix caching помогает, пока запросы идут по одной ветке — в живых сессиях этот паттерн быстро ломается.

  • Несколько агентов: субагент отрабатывает задачу, основной продолжает со своего снимка — общие десятки тысяч токенов считаются один раз.
  • Thinking-модели: токены рассуждения исчезают из истории, но снимок перед ответом даёт следующему ходу точку возобновления.
  • Ветвления и ретраи: при расхождении с кэшем догоняется только новая ветка.

Снимки ставят в точках ветвления, через интервалы в длинных промптах и прямо перед ответом — подход тот же, что в облачных агентских нагрузках Ollama. Запуск модели: ollama run gemma4:12b-mlx; для кодинг-агента — ollama launch pi --model gemma4:12b-mlx.

Источник: Ollama's highest performance on Apple Silicon yet with MLX.