标签聚合

大模型

大模型 领域的最新 AI 动态与独家辣评,共 50

QbitAI

蚂蚁OmniTable获VLDB最佳论文,35PB语料清洗提速5.6倍

  • 蚂蚁集团推出统一宽表系统 OmniTable,论文获评 VLDB 2026 工业赛道最佳论文。
  • 该系统用一套宽表方案管理 35PB 语料,显著简化大模型数据清洗流程。
  • 数据处理效率提升 5.6 倍,直击大模型训练中「洗数据」的高成本痛点。
2 小时前访问原文链接
QbitAI

神秘具身团队连发Demo,自进化模型技术路线曝光

  • 一支神秘具身智能团队连续放出多个高难度 Demo 视频,展示自进化模型能力。(基于标题摘要推断)
  • 其「自进化」技术路线被曝光,暗示模型可在执行任务过程中持续学习迭代。
  • 业内关注该路线能否突破具身智能对人工标注数据的依赖。
2 小时前访问原文链接
QbitAI

一个模型通吃多场景:它石智航AWE3.7泛化能力受关注

  • 它石智航发布 AWE3.7 模型,宣称单个模型可覆盖从工厂到家庭等多个场景。
  • 其泛化能力突出,展示从工业到家庭服务的一体化具身智能方案。
  • 具身智能正尝试用统一模型替代过去「一场景一模型」的碎片化方案。
2 小时前访问原文链接
QbitAI

陈大年复出入局大模型,首秀对标DeepSeek万亿旗舰

  • 知名互联网创业者陈大年宣布复出,正式入局大模型赛道。
  • 其团队首款模型号称性能逼近 DeepSeek 万亿参数旗舰级模型。
  • 老一代互联网人重返 AI 战场,为国产大模型竞争再添新变量。
2 小时前访问原文链接
QbitAI

世界生成模型迎来3D头部玩家,场景级生成进生产线

  • 一家 3D 头部玩家发布世界生成模型,支持单张图片直接生成可交互场景。
  • 该技术号称可进入生产管线,实现场景级生成,成果源自顶会最佳论文的工程化落地。
  • 这意味着世界模型正从研究演示走向影视、游戏、仿真等真实生产场景。
2 小时前访问原文链接
TheVerge_AI

谷歌 Gemini 3.8 Flash 更强但或更烧钱

  • 谷歌发布 Gemini 3.8 Flash,距前代仅数周
  • 新模型通过更多推理步骤与工具调用「更卖力」
  • 入门定价与 3.7 Flash 持平,但复杂任务可能更费 token
2 小时前访问原文链接
HackerNews

1.5 小时训出小模型 ARC 成绩超越大模型

  • 作者仅用 1.5 小时训练一个小型 transformer
  • 在 ARC 基准上取得 44% 成绩,超越许多大语言模型
  • 展示小模型在特定推理任务上的潜力
2 小时前访问原文链接
HackerNews

LLM 推理效率前沿:成本与质量的最优解

  • Baseten 分析 LLM 推理的「效率前沿」,探讨成本与质量权衡
  • 梳理不同规模模型在延迟、成本、质量间的取舍
  • 为模型选型与推理优化提供工程参考
2 小时前访问原文链接
HackerNews

研究揭示神经网络涌现出符号结构

  • arXiv 论文研究神经网络内部涌现的符号化结构
  • 为可解释性与大模型内部机制提供新理论视角
  • 触及神经网络与符号推理融合的经典问题
2 小时前访问原文链接
HackerNews

Anthropic 发布 Claude Fable 与 Mythos 5.1

  • Anthropic 同时发布 Claude Fable 5.1 与 Mythos 5.1 两款模型
  • Fable 定位创意叙事,Mythos 侧重复杂推理任务
  • 延续 Claude 多型号并行的产品矩阵策略
2 小时前访问原文链接
HackerNews

欧洲发布 438B 参数旗舰模型 Quasar

  • Multiverse Computing 发布 4380 亿参数的 Quasar 模型
  • 号称欧洲领先的大模型,主打主权 AI 能力
  • 欧洲在 AI 主权焦虑下加速自研大模型
2 小时前访问原文链接
HackerNews

WebLLM:浏览器内高性能大模型推理引擎

  • WebLLM 支持在浏览器内直接运行大语言模型推理
  • 基于 WebGPU 硬件加速,无需后端服务器即可本地部署
  • 开源项目,面向隐私敏感与边缘部署场景
2 小时前访问原文链接
HackerNews

中国大模型赛道迎来黑马 StartLux

  • 陈达伟回归,携新公司 StartLux 杀入中国大模型赛道
  • 被外媒称为中国 AI 竞争中的「黑马」
  • 本土大模型格局或将再添一支新势力
2 小时前访问原文链接
HackerNews

谷歌发布 Gemini 3.8 Flash 与安全版 Cyber

  • 谷歌推出 Gemini 3.8 Flash,较前代强化多步推理与工具迭代调用能力
  • 同步发布 Flash Cyber 变体,主打网络安全场景的定向增强
  • 入门定价维持与 3.7 Flash 一致,每百万输入 token 0.75 美元
2 小时前访问原文链接
TheVerge_AI

Meta AI推出Mac桌面应用

  • Meta推出Mac版AI应用,可分享当前窗口让聊天机器人基于屏幕内容作答。
  • Meta AI on Mac还支持跨应用语音听写,进一步贴近系统级助手体验。
14 天前访问原文链接
TheVerge_AI

谷歌Gemini推出学生专属学习中心

  • 谷歌在Gemini上线学生中心,整合研究收集、抽认卡、练习测验等功能。
  • 学习笔记本新增图表与图片支持,可自动添加考试日期等信息。
14 天前访问原文链接
ProductHunt

MiniMax Design:开放式创作的智能体团队

  • MiniMax推出面向开放式创作的智能体团队产品。
  • (基于标题摘要推断)用户可组建多个AI智能体协作完成创意任务。
14 天前访问原文链接
HackerNews

梯度下降训练神经网络的普适性研究

  • 论文研究梯度下降在神经网络训练中表现出的普适性规律。
  • (基于标题摘要推断)内容涉及优化算法为何能稳定收敛并找到泛化解。
14 天前访问原文链接
HackerNews

AI时代的数学:新的研究范式正在成形

  • 这是一篇arXiv论文,探讨AI如何改变数学研究的方式与边界。
  • (基于标题摘要推断)论文或讨论大模型辅助证明、猜想发现等新范式。
14 天前访问原文链接
HackerNews

AI没有抹杀初级工程师的价值,反而放大了它

  • 文章反驳“AI让初级工程师失业”的论调,认为初级岗位的价值反而被放大。
  • 作者指出AI接手重复编码后,新人能把精力投向更需判断力的工作。
14 天前访问原文链接
36Kr

小米AI业务入账249亿,百度AI占比过半

  • 小米二季度智能电动汽车及AI等创新业务收入达249亿元
  • 百度二季度总营收313亿元,AI业务收入占比连续过半
15 天前访问原文链接
HackerNews

Kent Beck用烘焙比喻讲透LLM训练

  • Kent Beck用烘焙比喻通俗解释大模型训练过程
  • 将数据、算力、调参与烘焙原料、火候进行类比
15 天前访问原文链接
HackerNews

AI时代的数学将走向何方

  • arXiv论文探讨AI对数学研究与证明方式的深层影响
  • 讨论机器证明与人类数学家角色的重新定位
15 天前访问原文链接
HackerNews

LLM City:Kimi K3权重3D可视化

  • 项目将Kimi K3大模型的全部权重渲染成3D城市
  • 每块2.5mm磁贴代表模型权重参数
  • 用可视化艺术呈现大模型的庞大结构
16 天前访问原文链接
HackerNews

AI写死代码,Go工具一键揪出

  • 文章指出AI编程助手常生成无人调用的死代码
  • Go团队的deadcode工具可一键检测冗余代码
  • 为AI生成代码的质量治理提供新思路
16 天前访问原文链接
HackerNews

专家证人借ChatGPT替3M辩护

  • 报道揭露一名专家证人用ChatGPT撰写报告
  • 在致命爆炸诉讼中为3M公司开脱辩护
  • AI生成法律文书的可信度引发广泛争议
16 天前访问原文链接
HackerNews

一行修复LLM尾延迟

  • 文章提出修复LLM尾延迟(P99)的简单方法
  • 通过请求级调度与重试策略优化长尾请求
  • 可显著改善LLM应用的整体响应体验
16 天前访问原文链接
HackerNews

GPT-5.6 Sol 登顶最强视觉模型

  • Roboflow评测称GPT-5.6 Sol是OpenAI最强视觉模型
  • 在OCR、图表理解、文档解析等任务表现突出
  • 多模态能力跃升,有望推动视觉应用爆发
16 天前访问原文链接
HackerNews

GPT-5.6 Sol 价格直降50%

  • OpenRouter页面显示GPT-5.6 Sol定价下调50%
  • 该模型以视觉能力见长,降价大幅降低调用成本
  • 旗舰模型价格战持续升级,利好下游应用开发者
16 天前访问原文链接
HackerNews

谷歌拍卖会抢购航司数据喂养AI

  • 谷歌在破产拍卖中购得Spirit航空的数据资产
  • 交易动机是补充AI训练所需的稀缺行业语料
  • 折射大厂对高质量私有数据日益激烈的争夺
16 天前访问原文链接
HackerNews

共享记忆的公共 AI 上线:所有用户共用一份记忆

  • 一款公开 AI 上线,其记忆在所有用户之间共享,形成集体性的知识池
  • 任何用户的交互都会沉淀进公共记忆,供后续所有用户调用
  • 该设计探索了 AI 记忆从「私有」走向「公共」的新型协作范式(基于标题摘要推断)
17 天前访问原文链接
HackerNews

「红皇后假说」为自进化 AI 指明新方向

  • 剑桥大学团队提出借鉴生物学「红皇后假说」,为自我改进 AI 设计新的进化路径
  • 该假说认为系统需持续进化才能维持竞争力,可指导 AI 的自适应学习与迭代
  • 研究试图解决自进化 AI 陷入停滞或退化的问题(基于标题摘要推断)
17 天前访问原文链接
HackerNews

Claude 正式公开系统提示词机制

  • Claude 平台在发布说明中新增「System Prompts」专题,正式文档化系统提示词用法
  • 系统提示词用于设定模型角色、边界与行为规范,是控制 Claude 输出的关键入口
  • 开发者可通过结构化提示词提升输出稳定性,减少幻觉与越界(基于标题摘要推断)
17 天前访问原文链接
ProductHunt

GLM-5.3 发布:同一底座靠后训练实现代码跃升

  • 智谱 Z.AI 发布 GLM-5.3,主打代码能力显著提升
  • 在不更换基础模型的前提下,通过扩展后训练(post-training)实现能力跃升
  • 体现“后训练”正成为提升模型能力的高性价比路线
18 天前访问原文链接
HackerNews

AI 幻觉问题到底解决了吗?

  • HN 用户发起讨论,质疑大模型的幻觉(hallucination)问题是否已被解决(基于标题摘要推断)
  • 社区观点分歧:检索增强与强化学习显著减少幻觉,但并未根除
  • 幻觉仍是 AI 进入生产环境的核心障碍之一
18 天前访问原文链接
HackerNews

AI 的工作记忆容量远超人类大脑?

  • 文章对比 AI 与人类的工作记忆(working memory)容量差异
  • AI 可同时处理海量上下文,而人类工作记忆仅约 4-7 个信息组块
  • 作者借此讨论“AI 是否超越数学家”等长期论战的意义
18 天前访问原文链接
HackerNews

AI 制药走到哪一步了?Science 博客盘点现状

  • Science 博客复盘 AI 在药物发现领域的实际进展与局限(基于标题摘要推断)
  • AI 已能加速分子筛选与靶点预测,但尚未带来颠覆性临床突破
  • 文章指出临床验证仍是最大瓶颈,需要长期持续投入
18 天前访问原文链接
HackerNews

只用小学教材训练大模型,会发生什么?

  • 研究者用不超过五年级难度的文本训练大模型,探索其能力边界(基于标题摘要推断)
  • 实验显示模型仍能习得一定语言与推理能力,但复杂概念理解受限
  • 为“训练数据质量 vs 数量”之争提供了独特观察视角
18 天前访问原文链接
HackerNews

Anthropic 发布多智能体系统的模式与问题研究

  • Anthropic 发布关于新兴多智能体系统(multi-agent)的研究,梳理常见的协作架构与模式
  • 研究指出多智能体在任务分工、通信协议、错误传播等方面仍存在诸多待解难题
  • 为开发者构建可靠的多智能体应用提供了参考框架与实践经验
18 天前访问原文链接
ProductHunt

Inferock Bench:给每次 LLM 调用开『收据』

  • Inferock Bench 为每一次 LLM API 调用生成独立的『收据』
  • 提供可审计、可验证的调用记录,便于计费与合规
  • 解决 AI 应用在成本核算与责任追溯上的难题
19 天前访问原文链接
HackerNews

阿里 AI 模型下载量破 30 亿,超 Meta 谷歌

  • 阿里旗下 AI 模型累计下载量突破 30 亿次
  • 在开源模型下载量上超越 Meta 与 Google
  • 反映国产开源大模型的全球影响力持续攀升
19 天前访问原文链接
TheVerge_AI

谷歌,还想赢下 AI 竞赛吗?

  • Decoder 播客探讨 Google 是否正在输掉 AI 竞赛
  • 起因是上周 Google DeepMind 的重大重组公告
  • Jeff Dean 与 Demis Hassabis 的人事变动成为焦点
20 天前访问原文链接
TheVerge_AI

苹果联手阿里,为中国市场定制 AI 模型

  • 苹果与阿里巴巴合作,为中国市场专门训练定制 AI 大模型
  • 这是中美科技巨头间罕见的数据与模型跨境合作
  • 意在合规落地苹果智能(Apple Intelligence)的中文版能力
20 天前访问原文链接
ProductHunt

ThreadPort:一键迁移各家 AI 对话记录

  • ThreadPort 支持在 ChatGPT、Claude、Gemini 之间一键迁移对话记录
  • 解决用户被锁定在单一平台、历史对话难带走的痛点
  • 降低多模型切换的迁移成本
20 天前访问原文链接
HackerNews

同一提示词喂 11 个模型,结果差异惊人

  • Netlify 用同一提示词分别测试 11 个大模型,输出结果差异显著
  • 揭示不同模型在代码生成、推理、风格上的鲜明差异
  • 提示开发者选型需结合实际任务而非单一基准分
20 天前访问原文链接
HackerNews

Mistral 发布 OCR 4.1,文档解析再升级

  • Mistral 发布 OCR 4.1 模型,强化文档解析与信息抽取能力
  • 面向扫描件、表格、复杂版面等真实文档场景优化
  • 延续开源生态路线,供开发者直接调用
20 天前访问原文链接
HackerNews

Cerebras 联手 OpenAI,加速 GPT-5.6 Sol 推理

  • Cerebras 与 OpenAI 合作,为 GPT-5.6 Sol Ultrafast 提供超高速推理加速
  • 借助 Cerebras 晶圆级芯片的高带宽优势,大幅降低首 token 延迟
  • 瞄准对实时性要求极高的推理场景
20 天前访问原文链接
HackerNews

谷歌发布 Gemini 3.7 Flash,主打编码与 Agent

  • Google 正式发布 Gemini 3.7 Flash,定位为编码与 Agent 场景的高性价比主力模型
  • 主打更低延迟与成本,面向开发者高频调用与智能体工作流
  • 延续 Flash 系列思路,在速度与能力之间取平衡
20 天前访问原文链接
HackerNews

DeepSeek 推错峰定价,API 按时段计价

  • DeepSeek 官方更新 API 定价,引入高峰与错峰时段的差异化计费策略
  • 错峰时段调用成本更低,鼓励开发者将批量任务调度到低峰期运行
  • 新定价与此前发布的 V4 Pro 模型配套,进一步压低推理成本
20 天前访问原文链接
TheVerge_AI

用 ChatGPT 给狗做癌症疫苗的人创办了公司

  • 曾用 ChatGPT、Grok 等 AI 工具为爱犬定制癌症疫苗的澳大利亚创业者成立新公司 Gamgee
  • 公司主打为宠物提供个性化 mRNA 癌症疫苗,并计划拓展更多方向
  • 事件引发对 AI 辅助生物医药研发的可行性讨论
21 天前访问原文链接