QbitAI2026年9月25日 12:0413 天前
DeepSeek 推理实测:PCIe 显卡吞吐翻近7倍
AI 摘要
- Meta-Infer 纯软件优化,8 张 PCIe 显卡跑 DeepSeek 吞吐 1932→13274 tok/s
- 手法是内核补齐、算子通信重构、并行容量调优与风险感知缓存复用,不改模型结构和权重
- 同一套方法用在 GLM5.3 上吞吐提升 1.92 倍,P95 首 Token 时延从 141.6 秒降到 46.6 秒
为什么重要
算力紧张下软件优化开始替代硬件堆料,长尾显卡的可用性直接改写大模型推理的成本结构。
- 手法是内核补齐、算子通信重构、并行容量调优与风险感知缓存复用,不改模型结构和权重
- 同一套方法用在 GLM5.3 上吞吐提升 1.92 倍,P95 首 Token 时延从 141.6 秒降到 46.6 秒
AI Pulse 编辑解读
硬件上限由芯片决定,能跑出多少由软件决定,这次终于有了实测数字。
风险与不确定性
数据来自厂商自测,换模型或换负载增益会缩水,落地前务必自行压测验证。
影响对象
开发者企业投资人
来源与透明度
本文由 AI Pulse 编辑部基于公开来源整理,摘要可能使用 AI 辅助生成,并经过人工检查标题、来源和关键信息一致性。
原始来源:QbitAI。发布时间:2026年9月25日 12:04。如果你发现事实错误或来源失效,欢迎通过联系页面提交纠错。