AI资讯新闻榜单内容搜索-VA-Bench

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
搜索: VA-Bench
看懂不等于做对:VA-Bench测出大模型空间智能的执行断层

看懂不等于做对:VA-Bench测出大模型空间智能的执行断层

看懂不等于做对:VA-Bench测出大模型空间智能的执行断层

VA-Bench测试12个主要多模态模型发现,Qwen3.8-max、Opus-5和GPT-5.6-sol虽在目标识别与定位上达100%、操作语义理解达99.6%—100%,完整任务成功率却仅为53.93%、52.86%和51.55%,暴露大模型从空间理解到执行与修正的断层。

来自主题: AI技术研报
8821 点击    2026-10-05 23:29