HackerNews2026年9月28日 12:0410 天前

llama.cpp 提速 42 倍:本地推理优化实测

AI 摘要

  • 开发者 Hayder Tirmazi 重构 llama.cpp 的 n-gram 缓存,草稿生成最快提速 42 倍。
  • 静态缓存加载从 3.76 秒压到 0.23 秒,541MB 缓存峰值内存从 1.71GB 降到 1.31GB。
  • 改动三处:内层 map 改引用读取、换 ankerl::unordered_dense、静态缓存改 constmap。

为什么重要

prompt lookup 是免费提速手段,草稿阶段从微秒级开销降到可忽略,让消费级硬件的本地推理更实用。

  • 静态缓存加载从 3.76 秒压到 0.23 秒,541MB 缓存峰值内存从 1.71GB 降到 1.31GB。
  • 改动三处:内层 map 改引用读取、换 ankerl::unordered_dense、静态缓存改 constmap。

AI Pulse 编辑解读

本地推理的瓶颈正从算力转向工程细节,C++ 数据结构优化仍是硬通货。

风险与不确定性

优化仍在 PR 阶段、未合并主干;现有版本需自行打补丁重新编译才能用。

影响对象

开发者研究者

相关专题

来源与透明度

本文由 AI Pulse 编辑部基于公开来源整理,摘要可能使用 AI 辅助生成,并经过人工检查标题、来源和关键信息一致性。

原始来源:HackerNews。发布时间:2026年9月28日 12:04。如果你发现事实错误或来源失效,欢迎通过联系页面提交纠错。

相关推荐