Ollama на Mac перешла на MLX: локальные кодинг-агенты быстрее вдвое

Ollama на Mac перешла на движок MLX — Apple-фреймворк для единой памяти. В превью 0.19 это ускоряет локальные кодинг-агенты вроде Claude Code и OpenClaw: быстрее первый токен и выше скорость генерации.
На чипах M5, M5 Pro и M5 Max задействуют GPU Neural Accelerators. Замеры на модели Qwen3.5-35B-A3B от 29 марта 2026 года: prefill вырос с 1154 до 1810 токенов в секунду, decode — со 58 до 112. С int4-квантованием в 0.19 обещают 1851 и 134 токенов/с; в сравнении стояла сборка Ollama 0.18 с квантованием Q4_K_M.
NVFP4 и кэш для длинных сессий
Ollama добавила поддержку формата NVFP4 от NVIDIA — меньше памяти и полосы, ответы ближе к облачному инференсу. Параллельно переработали кэш под агентские задачи с общим системным промптом и ветвлением:
- Кэш переиспользуется между разговорами — меньше памяти и больше попаданий при ветках в Claude Code.
- Умные чекпоинты — снимки кэша в нужных местах промпта, меньше повторной обработки.
- Умное вытеснение — общие префиксы дольше живут, даже когда старые ветки сбрасываются.
Как попробовать
Нужен Mac с более чем 32 ГБ unified memory. Скачай Ollama 0.19 и запусти модель, заточенную под кодинг:
Claude Code: ollama launch claude --model qwen3.5:35b-a3b-coding-nvfp4
OpenClaw: ollama launch openclaw --model qwen3.5:35b-a3b-coding-nvfp4
Чат с моделью: ollama run qwen3.5:35b-a3b-coding-nvfp4
Список поддерживаемых архитектур обещают расширять; для своих дообученных моделей готовят более простой импорт.
Источник: Ollama is now powered by MLX on Apple Silicon in preview.