VQA高分是在看图,还是在记答案?ReKey只更新决定答案的那一小块
VQA高分是在看图,还是在记答案?ReKey只更新决定答案的那一小块视觉问答模型的准确率不断提高,但高分未必来自视觉理解 —— 当基准图像与答案已进入训练语料,模型可能只是复现了记忆。浙江大学等团队提出 ReKey:保留原始真实场景,只更新决定答案的那一小块视觉线索,使每轮评测都面向未见过的内容。
搜索
视觉问答模型的准确率不断提高,但高分未必来自视觉理解 —— 当基准图像与答案已进入训练语料,模型可能只是复现了记忆。浙江大学等团队提出 ReKey:保留原始真实场景,只更新决定答案的那一小块视觉线索,使每轮评测都面向未见过的内容。
刚刚,杭州大模型公司西湖心辰宣布,公司近日完成数亿元人民币B+轮融资。该公司创始人蓝振忠,是卡耐基梅隆大学AI博士、自然语言处理预训练语言模型“ALBERT”第一作者,曾任谷歌人工智能研究院科学家,研究成果已被应用于Google News、Google Assistant 等数亿级用户产品中。他于2020年6月受聘于西湖大学,创办深度学习实验室并担任博士生导师。
如何从一段视频中获得完整、稳定的 3D 物体?过去,这个问题大致沿着两条路线发展。
当 VLA、WAM、RL、TAMP、MPC 等机器人控制策略在各自擅长的任务中大放异彩,如何刻画其能力边界,并在正确的时机为不同子任务匹配最合适的策略,正逐渐成为机器人完成复杂长时序任务的关键。
近年来,视觉 — 语言 — 动作模型(Vision-Language-Action Model,VLA)正逐渐成为通用机器人控制的重要技术路线,但当这些模型真正进入高频闭环执行时,一个矛盾越来越突出:模型越来越大、语义能力越来越强,动作更新却未必足够快。
这两天,AI圈百家争鸣。GPT-6曝光、DeepSeek V4 Flash公测、SD2.5发布、MiniMax多模态开源视频模型发布……
Agent的能力越来越强,但使用体验仍有一个尴尬之处: 每换一个Agent甚至换一个session,就像换了一个完全不了解你的新员工。
一个80亿参数的大模型,一口气吞下15万亿token的训练数据,堆到硬盘上差不多7TB。可它真正「背」得下来的,少得可怜:每个参数只装得下3.6 bit。一个英文字母8 bit,连半个都填不满。
近日,独立开发者 Harshal Singh 公布了一个仅有 3500 万参数的基础语言模型 BarunLM,并声称:「我预训练了世界上参数量小于 100M 的最好模型」。
近日,由清华大学深圳国际研究生院智能机器人实验室刘厚德教授领衔、王立博博士后担任 AI 首席研究员的大模型团队,正式发布了 VeriLoop Coder-E1—— 一款基于 Qwen3.6-27B 构建、面向仓库级代码修复与智能体式软件工程任务的开源垂类代码模型。