QbitAI2026年9月25日 12:0413 天前

DeepSeek 推理实测:PCIe 显卡吞吐翻近7倍

AI 摘要

  • Meta-Infer 纯软件优化,8 张 PCIe 显卡跑 DeepSeek 吞吐 1932→13274 tok/s
  • 手法是内核补齐、算子通信重构、并行容量调优与风险感知缓存复用,不改模型结构和权重
  • 同一套方法用在 GLM5.3 上吞吐提升 1.92 倍,P95 首 Token 时延从 141.6 秒降到 46.6 秒

为什么重要

算力紧张下软件优化开始替代硬件堆料,长尾显卡的可用性直接改写大模型推理的成本结构。

  • 手法是内核补齐、算子通信重构、并行容量调优与风险感知缓存复用,不改模型结构和权重
  • 同一套方法用在 GLM5.3 上吞吐提升 1.92 倍,P95 首 Token 时延从 141.6 秒降到 46.6 秒

AI Pulse 编辑解读

硬件上限由芯片决定,能跑出多少由软件决定,这次终于有了实测数字。

风险与不确定性

数据来自厂商自测,换模型或换负载增益会缩水,落地前务必自行压测验证。

影响对象

开发者企业投资人

来源与透明度

本文由 AI Pulse 编辑部基于公开来源整理,摘要可能使用 AI 辅助生成,并经过人工检查标题、来源和关键信息一致性。

原始来源:QbitAI。发布时间:2026年9月25日 12:04。如果你发现事实错误或来源失效,欢迎通过联系页面提交纠错。

相关推荐