HackerNews用「哈布斯堡下巴青蛙」测试各家AI绘图能力开发者创建了一个幽默的AI基准测试:让模型生成带有哈布斯堡王朝特征下巴的青蛙SVG不同AI模型在这个看似荒诞的任务上表现差异极大,暴露了多模态模型的创意理解差距该测试在HN获得143分高赞,被社区视为「非正式但有效」的AI能力评估方式1 个月前访问原文链接
HackerNews国产GLM-5.2在网络安全基准测试中击败Claude智谱AI发布开源模型GLM-5.2,在漏洞发现和网络安全场景中表现媲美Anthropic Mythos安全公司Semgrep实测显示GLM-5.2在代码审计任务上超越Claude,引发开源模型竞争力讨论2 个月前访问原文链接