Перейти к содержимому
Экосистема AI Vibe
← Назад к AI Vibe News

Редакция 21 июля 2026 г.

Новости

Ollama на Mac перешла на MLX: локальные кодинг-агенты быстрее вдвое

Локальный кодинг-агент на Mac ускоряется после перехода Ollama на движок MLX для Apple Silicon.

Ollama на Mac перешла на движок MLX — Apple-фреймворк для единой памяти. В превью 0.19 это ускоряет локальные кодинг-агенты вроде Claude Code и OpenClaw: быстрее первый токен и выше скорость генерации.

На чипах M5, M5 Pro и M5 Max задействуют GPU Neural Accelerators. Замеры на модели Qwen3.5-35B-A3B от 29 марта 2026 года: prefill вырос с 1154 до 1810 токенов в секунду, decode — со 58 до 112. С int4-квантованием в 0.19 обещают 1851 и 134 токенов/с; в сравнении стояла сборка Ollama 0.18 с квантованием Q4_K_M.

NVFP4 и кэш для длинных сессий

Ollama добавила поддержку формата NVFP4 от NVIDIA — меньше памяти и полосы, ответы ближе к облачному инференсу. Параллельно переработали кэш под агентские задачи с общим системным промптом и ветвлением:

  • Кэш переиспользуется между разговорами — меньше памяти и больше попаданий при ветках в Claude Code.
  • Умные чекпоинты — снимки кэша в нужных местах промпта, меньше повторной обработки.
  • Умное вытеснение — общие префиксы дольше живут, даже когда старые ветки сбрасываются.

Как попробовать

Нужен Mac с более чем 32 ГБ unified memory. Скачай Ollama 0.19 и запусти модель, заточенную под кодинг:

Claude Code: ollama launch claude --model qwen3.5:35b-a3b-coding-nvfp4
OpenClaw: ollama launch openclaw --model qwen3.5:35b-a3b-coding-nvfp4
Чат с моделью: ollama run qwen3.5:35b-a3b-coding-nvfp4

Список поддерживаемых архитектур обещают расширять; для своих дообученных моделей готовят более простой импорт.

Источник: Ollama is now powered by MLX on Apple Silicon in preview.