Gemini-2.0夺冠!全球首个几何推理专项评测出炉,淘天集团出品
Gemini-2.0夺冠!全球首个几何推理专项评测出炉,淘天集团出品多模态大模型几何解题哪家强?
来自主题: AI技术研报
9997 点击 2025-04-28 17:35
搜索
多模态大模型几何解题哪家强?
大模型技术加速向产业渗透,如何直击业务痛点、带来真实增效?
通过蒙特卡洛树搜索筛选高难度样本,ThinkLite-VL仅用少量数据就能显著提升视觉语言模型的推理能力,无需知识蒸馏,为高效训练提供了新思路。
一项来自清华大学和上海交通大学的研究颠覆了对可验证奖励强化学习(RLVR)的认知。RLVR被认为是打造自我进化大模型的关键,但实验表明,它可能只是提高了采样效率,而非真正赋予模型全新推理能力。
最近在看 Agent 方向的论文和产品,已经被各种进展看花了眼。但我发现,真正能超越 demo,能在 B 端场景扎实落地的却寥寥无几。
近期,美国FDA正式宣布计划逐步取消在单抗疗法等药物研发中对动物实验的强制性要求。
人类病毒学家为人工智能(AI)设计了一项极其困难的测试,结果令人担忧:
今年以来,AI代理开始彻底爆发,越来越多AI代理产品上线,并快速进入商业化阶段。
自主通才科学家(AGS)正成为现实!
大型语言模型(LLMs)在广泛的自然语言处理(NLP)任务中展现出了卓越的能力。