Ollama2026年9月23日 12:0515 天前

Ollama MLX 深度实测:Mac 本地推理提速 20%

AI 摘要

  • Ollama 更新 MLX 引擎,Apple Silicon 输出速度最高提升 20%
  • 新增 NVIDIA NVFP4 量化支持,官方称把 Gemma 4 12B 的 4bit 量化质量损失减半
  • 引入快照机制,多 Agent、思考模型、分支重试可复用上下文,避免重复处理 prompt
  • 启动方式 ollama run gemma4:12b-mlx,或一条命令把模型接进 agent

为什么重要

开源模型的本地可用性再进一步,个人开发者用一台 Mac 跑 coding agent 越来越现实。

  • 新增 NVIDIA NVFP4 量化支持,官方称把 Gemma 4 12B 的 4bit 量化质量损失减半
  • 引入快照机制,多 Agent、思考模型、分支重试可复用上下文,避免重复处理 prompt
  • 启动方式 ollama run gemma4:12b-mlx,或一条命令把模型接进 agent

AI Pulse 编辑解读

真正值钱的不是 20% 提速,而是快照机制对 Agent 长上下文的省钱效果。

风险与不确定性

收益主要落在 Apple Silicon,Intel 与 AMD 用户仍依赖 Vulkan 路线。

影响对象

开发者普通用户

来源与透明度

本文由 AI Pulse 编辑部基于公开来源整理,摘要可能使用 AI 辅助生成,并经过人工检查标题、来源和关键信息一致性。

原始来源:Ollama。发布时间:2026年9月23日 12:05。如果你发现事实错误或来源失效,欢迎通过联系页面提交纠错。

相关推荐