HackerNewsDeepSeek-v4.1 Flash 突破 KV 缓存压缩极限DeepSeek-v4.1 Flash 聚焦 KV Cache 压缩技术,大幅降低推理时的显存与计算开销。该架构有望在长上下文场景下显著降低部署成本。是国产模型在推理效率上的又一次技术突破。22 天前访问原文链接
HackerNews从输入 Prompt 到看见第一个字:LLM 推理全链路深度解析文章逐层拆解了从用户输入 prompt 到 LLM 输出第一个 token 的完整技术链路,涵盖 tokenization、KV cache、自回归解码等环节重点解释了推理阶段的计算瓶颈——KV cache 的内存占用和 attention 机制的计算复杂度是导致首 token 延迟的核心原因提供了可视化时序图和 Python 代码示例,适合想深入理解 LLM 推理引擎原理的开发者阅读2 个月前访问原文链接