揭开多智能体决策的隐形不公,结果指标相同也未必可靠 | EMNLP'26
揭开多智能体决策的隐形不公,结果指标相同也未必可靠 | EMNLP'26当多个大语言模型(LLM)组成「招聘委员会」,共同筛选简历、讨论候选人、打分并投票时,我们通常会用最终录用率来判断系统是否公平。
搜索
当多个大语言模型(LLM)组成「招聘委员会」,共同筛选简历、讨论候选人、打分并投票时,我们通常会用最终录用率来判断系统是否公平。
MiniMax H3 的开源,可能比外界看到得更仓促。
字节跳动创始人张一鸣亲自督战基于Seedance打造的空间视频生成AI模型,预计最快10月面世,该模型可响应PICO头显用户指令实时生成虚拟世界,有望盘活PICO并推动字节进入世界模型赛道。
在大模型的发展中,提升能力的主要手段一直是 "做大"—— 更多参数、更多数据、更多算力。如今,另一条思路开始受到关注:与其不断堆叠新的层,不如让已有的层再跑一遍。这就是 Looped Transformer。普通 Transformer 的每一层只执行一次,而 Looped Transformer 会把其中一部分层重复执行,让模型在不增加参数的情况下获得更深的计算。
智象未来(HiDream.ai)正式发布具身世界模型HiDream-O1-Embodied,该模型在具身智能评测平台RoboColiseum扰动适应子榜单中以0.692分登顶榜首,标志着智象原生全模态世界模型矩阵的进一步完善。
近期发表于 Nature Machine Intelligence 的论文 Towards principled knowledge editing methods for large language model reasoning [1],从知识编辑切入,进一步探索大模型如何使用知识进行推理以及如何通过主动干预观察模型内部变化。
GPT-6咋跑去给字节Seedance打工了???
作者苍何利用Seko平台的出海剧转绘、剧本裂变与出海原创短剧skill,将国内短剧本地化改编为泰国、美国、韩国等海外版本,结合seed Audio 1.0音频翻译实现低成本AI短剧出海,展示普通人抓住2026年海外40亿美元短剧市场的可行路径。
前DeepSeek核心研究员魏浩然近日带队加入百度基础模型研发部,出任文心大模型多模态算法负责人,负责端到端OCR等方向,其此前主导的Unlimited OCR模型曾在OmniDocBench评测中取得全球第一。
Bun 1.4正式发布,核心开发者Jarred Sumner利用AI Agent在11天内将底层代码从Zig重写为Rust,生成超100万行代码并烧掉约16.5万美元Token,InfluxDB创始人Paul Dix发文《The end of programming》指出传统编程方式正走向消亡。