HackerNews250美元FPGA上运行微型LLM,推理速度21000 tok/s开发者展示了在250美元FPGA上运行LLM的原型,达到21000 tok/s使用KV260 FPGA开发板实现完全离线推理,功耗极低该方案展示了专用硬件替代GPU运行AI模型的可行路径3 小时前访问原文链接