广告

Kimi开源PerceptionBench视觉感知基准,GPT-5.6-Sol准确率居首但无模型突破60%

发布日期:2026-07-28 22:41 阅读:
金牌财经排行榜报道,Kimi Team宣布开源多模态大模型视觉感知评测基准PerceptionBench,旨在将视觉感知能力拆解为10项原子级能力进行独立评估,涵盖视觉关系、计数、属性、深度与3D、定位、比较、细粒度识别、上下文整合、OCR及幻觉识别等维度。该基准基于42个现有评测集中的模型失败案例构建,共包含3000道经人工验证的问题,每题仅考察单一视觉能力,无需推理或外部知识。
评测结果显示,在16款前沿多模态大模型中,没有任何模型整体准确率超过60%。GPT-5.6-Sol以59.7%的准确率排名第一,Kimi K3(58.5%)、Claude-Fable-5(57.2%)、Gemini-3.1-Pro(56.2%)和GPT-5.5(55.8%)位列前五。报告指出,视觉幻觉(Hallucination)仍是各模型表现最弱的能力,整体感知能力仍存在显著提升空间。

发表我的意见

专栏作者

2808

文章

0

提问

295万+

阅读量

0

回答

26万+

被赞

0

余额

关于我们 联系我们 加入我们 免责声明 广告服务 Sitemap 标签Tag 侵权文章删除:13607219@qq.com 微信:wenlian123com Investor Relations © 2025 金牌网 中值联认证中心(北京)有限公司版权所有 ICP备案:京ICP备20020888号 增值电信经营许可证:京B2-20201851