HackerNewsSchema Harness在Arc-AGI-3基准测试上达到99%准确率Schema Harness系统在Arc-AGI-3公开测试集上取得了约99%的惊人成绩Arc-AGI-3是衡量AI通用智能推理能力的权威基准测试,此前最佳成绩远低于此该系统采用结构化推理框架,不同于传统端到端深度学习方法1 个月前访问原文链接
HackerNewsAI「狗屁」作品赢得DeepMind 2.5万美元Kaggle大奖引争议Kaggle举办的AGI测量竞赛中,一篇被社区广泛质疑为AI生成的「狗屁」作品获得了2.5万美元大奖该作品引发对AI评估基准和竞赛评审机制的广泛讨论,凸显AI生成内容对学术评价体系的冲击DeepMind和Kaggle尚未公开回应评审流程是否存在漏洞1 个月前访问原文链接