AI资讯新闻榜单内容搜索-NLP

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
搜索: NLP
EMNLP 2026 Main|预测越像真实环境,Agent反而做得更差?我们把世界模型的训练目标从"状态一致"换成了"行为一致"

EMNLP 2026 Main|预测越像真实环境,Agent反而做得更差?我们把世界模型的训练目标从"状态一致"换成了"行为一致"

EMNLP 2026 Main|预测越像真实环境,Agent反而做得更差?我们把世界模型的训练目标从"状态一致"换成了"行为一致"

一句话概括:文本世界模型都在比 "生成文本像不像真实环境",但我们发现文本更接近真实环境的预测反而可能让智能体错得更离谱。把训练目标从 "状态一致" 换成 "行为一致" 后,16 组实验配置下世界模型的轨迹级一致性几乎全面提升,弱智能体离线评测的假阳性率从 42.5% 降到 9.5%。

来自主题: AI技术研报
5895 点击    2026-09-08 15:06
具身ICL来了创业玩家!上下文成Scaling新赛道

具身ICL来了创业玩家!上下文成Scaling新赛道

具身ICL来了创业玩家!上下文成Scaling新赛道

2020年,GPT-3靠“看几个示例就会新任务”震动了NLP界;六年后的今天,同样的故事正在具身智能领域上演。

来自主题: AI资讯
9360 点击    2026-09-07 10:47
0.25秒识破未见攻击,这套检测方法没看过任何越狱样本 | EMNLP'26

0.25秒识破未见攻击,这套检测方法没看过任何越狱样本 | EMNLP'26

0.25秒识破未见攻击,这套检测方法没看过任何越狱样本 | EMNLP'26

大视觉语言模型(LVLM)把语言理解扩展到了图像等多模态输入,同时,也带来了更隐蔽的攻击面。

来自主题: AI技术研报
5687 点击    2026-09-03 09:50
面壁智能发布数字员工全流程构建平台StaffDeck,给AI发工号、定岗位、做绩效

面壁智能发布数字员工全流程构建平台StaffDeck,给AI发工号、定岗位、做绩效

面壁智能发布数字员工全流程构建平台StaffDeck,给AI发工号、定岗位、做绩效

为了解决当前AI Agent存在的这些问题,面壁智能联合东北大学-面壁智能数据智能联合实验室、清华大学THUNLP实验室、OpenBMB与AI9Stars,正式开源了数字员工全流程构建与管理平台——StaffDeck。

来自主题: AI资讯
9658 点击    2026-07-18 10:51
ICML 2026|如何对Multi-Agent系统进行过程评估?重新认识多智能体系统中的Orchestrator

ICML 2026|如何对Multi-Agent系统进行过程评估?重新认识多智能体系统中的Orchestrator

ICML 2026|如何对Multi-Agent系统进行过程评估?重新认识多智能体系统中的Orchestrator

来自南京大学 NLP 实验室的 ICML 2026 论文 Recognize Your Orchestrator: An Entropy Dynamics Perspective for LLM Multi-Agent Systems 指出:在当前主流的 Orchestrator-Executor 多智能体架构中,系统失败往往并不首先来自某个执行器不会干活,

来自主题: AI技术研报
8921 点击    2026-07-06 15:48
从57场面试到OpenAI offer:一位NLP博士的顶级AI公司求职复盘火了

从57场面试到OpenAI offer:一位NLP博士的顶级AI公司求职复盘火了

从57场面试到OpenAI offer:一位NLP博士的顶级AI公司求职复盘火了

今天,华盛顿大学即将毕业的博士生 Alisa Liu 要加入 OpenAI 的消息上了 X 热搜。主贴浏览量已突破百万,她表示这次找工作的过程比想象中更有挑战,但也收获满满。所以她写了一篇小博客,分享一路走来学到的经验,也希望能让下一个经历这个过程的人少一点困惑。

来自主题: AI资讯
9878 点击    2026-06-23 10:16
「马嘉祺」让大模型翻车,而他一年前洗澡时就发现了问题

「马嘉祺」让大模型翻车,而他一年前洗澡时就发现了问题

「马嘉祺」让大模型翻车,而他一年前洗澡时就发现了问题

一家名为脸谱心智(FaceMind)的初创公司就在顶级学术会议 EMNLP 主会上系统性地揭示了这个问题,并给出了解法。更有意思的是,就在「马嘉祺」事件前不到两周,全球最强 AI 公司之一 Anthropic 也在自家产品中悄悄落地了一次高度相关的改造 —— 方向与脸谱心智一年前的论文几乎完全一致。

来自主题: AI技术研报
8335 点击    2026-05-30 10:05
阿里面试官冷笑:"5000 份文档扔进去就算建好知识库了?难怪你的 RAG 答非所问。" 我无言以对...

阿里面试官冷笑:"5000 份文档扔进去就算建好知识库了?难怪你的 RAG 答非所问。" 我无言以对...

阿里面试官冷笑:"5000 份文档扔进去就算建好知识库了?难怪你的 RAG 答非所问。" 我无言以对...

大家好,我是吴师兄。 之前有个学员面阿里的 NLP 岗,简历上写着"搭建了基于 RAG 的企业知识问答系统"。面试官翻着简历问: "你们知识库有多少文档?什么格式?" 他说:"大概 5000 份,PD

来自主题: AI技术研报
8642 点击    2026-03-29 10:50
复旦北大联合美团LongCat提出TDAR:用“粗思考,细求证”破解Block Diffusion的速度精度悖论

复旦北大联合美团LongCat提出TDAR:用“粗思考,细求证”破解Block Diffusion的速度精度悖论

复旦北大联合美团LongCat提出TDAR:用“粗思考,细求证”破解Block Diffusion的速度精度悖论

近期,复旦大学 NLP 实验室(FDU NLP)、北京大学知识计算实验室(KCL)联合美团 LongCat Team 提出了一种 Block Diffusion 推理模型 Test-Time Scaling 新框架 TDAR,通过引入 “粗思考,细求证” (Think Coarse Critic Fine, TCCF) 范式与有界自适应置信度解码

来自主题: AI技术研报
8604 点击    2026-03-14 08:39