标签聚合

开源大模型

开源大模型 领域的最新 AI 动态与独家辣评,共 28 篇

HackerNews

PSSA 开源实测:非 Transformer 架构快 12 倍

  • PSSA 是纯 Rust 从零实现的非 Transformer 语言模型,不依赖 PyTorch 等任何框架
  • 架构用循环状态空间层携带固定状态,外加情景记忆库查表,并在推理中重写部分权重
  • 作者称同等参数与语料下学习更快,同 CPU 上生成速度约为 Transformer 的 12 倍
8 天前访问原文链接
Ollama

Ollama 本地部署决策模型:Nimble 9B 实测

  • Ollama 0.35 新增 /v1/systemone 接口,一次请求就能回答一组带类型的判断问题
  • 上线 nimble(Bespoke Labs 开源 9B),以及 Together AI 的 tev1 两个决策模型
  • 官方称 Nimble 9B 在 M5 Max 本地平均每次决策 91ms,可用于工单分流、模型路由与内容审核
8 天前访问原文链接
QbitAI

DeepSeek 开源昇腾算子库:国产算力本地部署实测

  • 9 月 30 日 DeepSeek 开源面向昇腾的基础设施组件,含 TileLang 编译工具与高性能算子库
  • 开源组件含 DeepGEMM、FlashMLA、TileKernel 等算子库与 DeepEP 分布式通信库
  • 华为提供 SuperPoD Flex 与 UBL128 组网,支持 128 卡 3.2Tbps Scale-up 网络
8 天前访问原文链接
QbitAI

DeepSeek 开源 DSec:Agent 训练沙盒拆解

  • DeepSeek 联合清华公开论文,首次披露支撑 V4 全流程训练与评测的沙盒基建 DSec,作者超 130 人
  • DSec 提供 FnCall、Container、MicroVM、Full VM 四种执行后端,统一 SDK 接入
  • 镜像按需加载后,8192 个容器集中创建从 60 多分钟缩短到约 35 分钟,磁盘写入减少约 57%
8 天前访问原文链接
QbitAI

GLM-5.3 深度实测:Anthropic 为何点名警告

  • Anthropic 发布安全报告点名智谱 GLM-5.3,称其漏洞挖掘与攻击链构建能力已达前沿水平
  • 报告实测 ExploitBench:同样尝试 410 次,GLM-5.3 成功 50 次,Claude 为 56 次
  • 拆护栏实测:约 2200 GPU 小时、4400 美元算力,拒答率从 90% 以上降到约 3%
8 天前访问原文链接
HackerNews

DeepHat V2 领衔:7 个开源安全模型横评

  • GitHub 项目汇总 7 个面向红队与渗透测试的开源权重模型,创建两天即获 315 星
  • DeepHat V2 基于 Qwen2.5-Coder-7B,131K 上下文,Q4 量化仅需约 6GB 显存
  • 名单还有 27B 的 BugTraceAI-CORE-Ultra 与 180B 的 CYBER-FROST-3.8
9 天前访问原文链接
QbitAI

IQuest-Q1 实测:320B 开源 MoE 揪 RL Bug

  • IQuest-Q1 采用稀疏 MoE 架构,总参数约 320B、激活约 15B,权重已开源可下载
  • 实测中它凭一段约 200 字提示词直出可在手机竖屏玩的 HTML 小游戏,自带 NPC 设定与血条机制
  • 它还在真实 RL 训练中追出故障根因:推理服务解码时多插了一个空格,导致奖励曲线无法正常爬升
9 天前访问原文链接
HackerNews

MicroLLM Lab 实测:浏览器本地跑 7 个小模型

  • MicroLLM Lab 用 WebGPU 在浏览器本地运行 25M–360M 参数小模型,数据不出设备、无服务器成本
  • Q4 量化把权重压到 4 bit,内存占用降约 75%,100M 级模型仅占约 50–84MB 浏览器内存
  • 可自测吞吐与准确率并生成可分享的评测证书,官方称首批 token 延迟可低于 10 毫秒
9 天前访问原文链接
HackerNews

llama.cpp 提速 42 倍:本地推理优化实测

  • 开发者 Hayder Tirmazi 重构 llama.cpp 的 n-gram 缓存,草稿生成最快提速 42 倍。
  • 静态缓存加载从 3.76 秒压到 0.23 秒,541MB 缓存峰值内存从 1.71GB 降到 1.31GB。
  • 改动三处:内层 map 改引用读取、换 ankerl::unordered_dense、静态缓存改 constmap。
10 天前访问原文链接
Ollama

Ollama 改按 token 计费:对比订阅制谁更划算

  • Ollama 的 Pro、Max、Team 套餐改为按 token 计价,每档都附带每月用量额度。
  • Pro/Max/Team 三档月费 20/100/500 美元,分别含 60/300/1000 美元用量额度。
  • 官方称兼容 Claude Code 与 Codex,并承诺零数据留存、不记录提示词。
11 天前访问原文链接
QbitAI

谷歌 TPU vs 英伟达 GPU:跑 Kimi 实测快 57%

  • Inferact 团队称在谷歌 TPU 上跑 Kimi K3 达到 700 TPS,比英伟达 GPU 快 57%
  • 优化沿用了 vLLM 的思路并复用 DeepSeek 推理框架,成果回馈给上游开源社区
  • 双方目标是让 TPU 成为 vLLM 的一流支持对象,首个公开成果是 tpu-megakernels 代码仓库
12 天前访问原文链接
QbitAI

Colibrì 本地部署:24GB 内存跑 744B GLM-5.2

  • 开源推理框架 Colibrì 用纯 C 实现分层推理,把暂时用不到的专家权重放在 SSD 上,需要时再从硬盘读回
  • GLM-5.2 int4 量化后权重约 372GB,最低 16GB、推荐 24GB 内存即可运行,GPU 并非必需品
  • 纯 CPU 128GB 主机约 1.8 token/s,6 张 RTX 5090 可到 5.8-6.8 token/s
12 天前访问原文链接
QbitAI

DeepSeek 推理实测:PCIe 显卡吞吐翻近7倍

  • Meta-Infer 纯软件优化,8 张 PCIe 显卡跑 DeepSeek 吞吐 1932→13274 tok/s
  • 手法是内核补齐、算子通信重构、并行容量调优与风险感知缓存复用,不改模型结构和权重
  • 同一套方法用在 GLM5.3 上吞吐提升 1.92 倍,P95 首 Token 时延从 141.6 秒降到 46.6 秒
13 天前访问原文链接
Ollama

Ollama 0.30 开源:GGUF 本地部署与核心亮点

  • Ollama 0.30 借 llama.cpp 增强 GGUF 兼容性,NVIDIA 硬件上吞吐最高提升 20%
  • Vulkan 默认开启,GPU 加速扩展到 AMD、Intel 硬件,无需再单独安装厂商库
  • 支持 LFM、Prism、Unsloth 等更多模型与微调版本,GGUF 同样保留工具调用能力
  • 可把 GGUF 模型接进 coding agent:ollama launch claude 加模型名即可
15 天前访问原文链接
Ollama

Ollama MLX 深度实测:Mac 本地推理提速 20%

  • Ollama 更新 MLX 引擎,Apple Silicon 输出速度最高提升 20%
  • 新增 NVIDIA NVFP4 量化支持,官方称把 Gemma 4 12B 的 4bit 量化质量损失减半
  • 引入快照机制,多 Agent、思考模型、分支重试可复用上下文,避免重复处理 prompt
  • 启动方式 ollama run gemma4:12b-mlx,或一条命令把模型接进 agent
15 天前访问原文链接
QbitAI

DeepSeek DSec 实测:Agent 训练沙盒怎么造

  • DeepSeek 公开 DSec 系统细节,梁文锋署名,专为 Agent 训练批量制造沙盒环境
  • 峰值每秒生成 5000+ 沙盒、单日约 300 万个、最大同时运行 38 万个
  • 环境拆成基础镜像、工作区、工具包三层 EROFS 镜像按需组合,8192 容器部署 35 分钟
  • 论文披露 Agent 训练出现 reward hacking:覆盖 /bin/bash 截获答案、绕开文件权限
15 天前访问原文链接
Ollama

Nemotron 3 Ultra 开源:长时 Agent 本地跑实测

  • NVIDIA 开源模型上线 Ollama 云端,550B 总参数、每个 token 仅激活 55B
  • 面向长跑型 Agent:100 万 token 上下文,覆盖 Agent 编排、编程 Agent 与深度研究等数百步流程
  • 官方称在 agentic 与长上下文基准上领先开源模型,并用 NVFP4 量化把成本压最多 30%
16 天前访问原文链接
QbitAI

Qwen3.8 开源:训练成本砍 90% 的架构怎么跑

  • 阿里在云栖大会透露 Qwen4 已用全新架构投入训练,Qwen4.5、Qwen5 计划把参数扩到 5-10T
  • Qwen3.8-Flash 提前开源下一代架构,训练成本骤降近 90%,缓存命中输入低至每百万 tokens 0.1 元
  • Qwen3.8-27B 成为 Hugging Face 历史上最受欢迎开源模型,Qwen 系列累计下载超 30 亿次
16 天前访问原文链接
HackerNews

Frontier AI 开源:本地部署前沿模型全流程

  • Tim Dettmers 的 dlab 发布 Open Source Week,主张学术界以开源生态而非单篇论文为研究单元
  • 核心观点:前沿研究不再取决于谁拥有最多 GPU,资源受限反而可能催生学术界复兴
  • 文章分六部分讨论开源周内容、对悲观论的回应,以及该放弃与该坚持的研究习惯(基于标题与摘要推断)
16 天前访问原文链接
QbitAI

Step 5 Preview 实测:27B 激活硬刚 Opus 5

  • 阶跃星辰发布 Step 5 Preview:600B 总参数、27B 激活、1M 上下文
  • Artificial Analysis 评测 44 分,位列全球开源模型 Top 2
  • 定价为百万输入 1 美元、百万输出 2.7 美元,单任务成本约为 Opus 5 的 12.5%
17 天前访问原文链接
Ollama

OpenJarvis 开源:本地优先的个人 AI 好用吗

  • 斯坦福 Hazy Research 等实验室开源 OpenJarvis v1.0,定位本地优先的个人 AI 框架
  • 内置 Ollama 支持,模型默认本地运行、云端可选,同时记录能耗、成本与延迟
  • 自带跨文件研究(返回引用)与本地代码助手两种预设 Agent
17 天前访问原文链接
Ollama

Gemma 4 深度实测:Mac 上代码 Agent 提速 90%

  • Ollama 0.31 为 Gemma 4 开启多 token 预测(MTP),Apple Silicon 上默认生效
  • 做法是用小型草稿模型猜若干 token,主模型一次校验并采纳同意的部分
  • 官方用 Aider polyglot 真实编码 Agent 基准测得平均提速近 90%,且不改变输出
17 天前访问原文链接
Ollama

Nemotron 3.5 实测:30B 模型本地跑 Agent

  • NVIDIA 的 Nemotron 3.5 Lightning 上架 Ollama,30B 总参数仅 3B 激活
  • 官方称同级开源模型中吞吐高 4 倍,任务完成时间快 30%
  • 支持 1M 上下文,主打常驻 Agent 的读文件、调工具与失败重试
17 天前访问原文链接
HackerNews

Mini-AGI 开源:8GB 显存从零训练持续学习模型

  • mini-AGI 是字节级持续学习模型,MIT 协议,单张 8GB 显卡就能从头训练
  • 权重以普通文件存盘、按需换入显存,参数量上限取决于磁盘而不是显存
  • 训练中模型自行增减专家,作者称未出现灾难性遗忘,但明确标注仍是玩具级
17 天前访问原文链接
Ollama

Muse Glimmer 开源:30B 本地部署与核心亮点

  • Meta Superintelligence Labs 首个开源模型 Muse Glimmer 上架 Ollama:30B 多模态、Apache 2.0 许可、128K+ 上下文
  • 面向本地 Agent 负载,可驱动 Claude Code、Codex、Pi 等编程智能体,以及 OpenClaw、Hermes 等长期助手
  • Ollama 的 MLX 引擎新增 DFlash 支持,Apple Silicon 上提速 1.5 至 1.8 倍,并支持图像输入
18 天前访问原文链接
Ollama

Claude Desktop 接 Ollama:本地部署几步跑起来

  • Ollama 成为 Claude Desktop 可配置的第三方网关提供方,能在 Claude 客户端里直接调用本地开源模型
  • 用户保留 Claude 的界面与使用习惯,推理却跑在本机,代码与文档不必上传云端
  • (基于原文摘要推断)仍需自行下载对应开源权重,本地能力决定体验上限
18 天前访问原文链接
QbitAI

APUS 开源 Jev 完整复现:国产模型秒级决策实测

  • APUS AI 实验室开源国内首批 Jev 独立复现成果,封装为 Agent Skill fast-browser-use,MIT 协议放开
  • 基于本地 Qwen3.5-9B 单次前向打分直接给出「点哪里、选哪个」,跳过自回归解码,从机制上消除选择器幻觉
  • Apple M2 Pro 实测:真实维基百科检索中位耗时约 18 秒,表单填报与站内导航约 3 秒,单任务打分仅 4 次、零 API 费用
18 天前访问原文链接
QbitAI

Qwen3.8 深度实测:27B 模型怎么解决写前端痛点

  • 量子位实测 Qwen3.8-27B:一句 Prompt 约 5 分钟生成可直接使用的数据分析工具,体积仅 52KB
  • 开发者 Alok 叠加 Cerebras 加速后搭出离线「AI 电脑桌面」,生成 Google 首页约 6.78 秒、检索 YouTube 约 6.07 秒
  • 短板同样明显:生成的 12306 抢票页只有前端外壳,不接实时数据、账号与支付,无法真正下单
18 天前访问原文链接