AI技术研报-这里有最前沿的人工智能技术解读

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
我们实测TRAE Work的这份攻略,被官方收进知识库了

我们实测TRAE Work的这份攻略,被官方收进知识库了

我们实测TRAE Work的这份攻略,被官方收进知识库了

上周我们发了一篇Agent大横评的文章三家评测,结果评论区出现了一个高频问题: “字节的TRAE Work建议测一下。”

来自主题: AI技术研报
8906 点击    2026-07-27 16:07
AI最尴尬的短板,中国科学院出手了

AI最尴尬的短板,中国科学院出手了

AI最尴尬的短板,中国科学院出手了

GPT-5.5能写专业论文,DeepSeek-V4-Pro能生成复杂代码,具身机器人能完成基础物理操作,语言智能和工具智能都已经跑出了自己的赛道。

来自主题: AI技术研报
7156 点击    2026-07-27 15:50
Claude Opus 5,第一次杀死 Harness?

Claude Opus 5,第一次杀死 Harness?

Claude Opus 5,第一次杀死 Harness?

7 月 24 日,Claude Opus 5 上线。几个小时之内,我看到各家媒体把这个模型的评测成绩转载了一轮,而更值得留意的是 Anthropic 内部人员当天发出的一条推文。

来自主题: AI技术研报
7231 点击    2026-07-27 11:31
浪费20亿Token之后,我做了一个帮自己定义目标的Skill。

浪费20亿Token之后,我做了一个帮自己定义目标的Skill。

浪费20亿Token之后,我做了一个帮自己定义目标的Skill。

今天给大家开源一个我自己周末做完然后用的很爽的Skill。 我把它称为, Leader.skill。

来自主题: AI技术研报
7646 点击    2026-07-27 11:10
我给 codex 装的最有用的 skill,是反过来盘我的

我给 codex 装的最有用的 skill,是反过来盘我的

我给 codex 装的最有用的 skill,是反过来盘我的

装完 codex,很多人在输入框里敲的第一句话是这样的:帮我做个 XX 网站。

来自主题: AI技术研报
8280 点击    2026-07-27 11:10
试完Codex这4个神仙用法,彻底回不去了...【建议收藏】

试完Codex这4个神仙用法,彻底回不去了...【建议收藏】

试完Codex这4个神仙用法,彻底回不去了...【建议收藏】

大家好,我是连续充值Codex Pro会员4个月的袋鼠帝。 不得不说,Codex是真香,一开始我还是100刀的Pro 自从GPT-5.6出来之后,已经改成200$的会员了。

来自主题: AI技术研报
5982 点击    2026-07-27 11:09
分享一个很前沿的 AI4AI 成果:两个月,把 Deep Search 做到了SOTA

分享一个很前沿的 AI4AI 成果:两个月,把 Deep Search 做到了SOTA

分享一个很前沿的 AI4AI 成果:两个月,把 Deep Search 做到了SOTA

刚读了一篇 AI4AI 论文《AI4AI at Scale》,来自 XYZ Agentic Team。还是第一次听到这个 Lab。他们用 AI4AI 的方式做出了两个很强的搜索 agent,也公开了方法。借这篇 paper 讲讲 AI4AI 到底怎么工作,下面尽量少堆术语。

来自主题: AI技术研报
8180 点击    2026-07-26 15:38
Vibe Coding撞墙了?换个思路治好AI编程的「局部失忆」

Vibe Coding撞墙了?换个思路治好AI编程的「局部失忆」

Vibe Coding撞墙了?换个思路治好AI编程的「局部失忆」

现在的 Agent 将所有的工程线索和垃圾噪音都一股脑扔进 Chat Context 里,缺乏一层独立、结构化的 Engineering State 来做隔离与控制。为了打破这个瓶颈,Valkor 联合浙江大学智能计算与软件研究中心、伦敦大学学院(UCL)软件工程团队正式推出并开源了 loom。

来自主题: AI技术研报
8499 点击    2026-07-26 14:21
迈向长程智能体,人大高瓴发布149页全景综述

迈向长程智能体,人大高瓴发布149页全景综述

迈向长程智能体,人大高瓴发布149页全景综述

我们想强调的是:智能体 “跑得久”,并不等于 “具备长程能力”。真正的关键,不在于占用更多时间与算力,而在于能否在更长、更复杂、更真实的推理依赖链上持续、有效地行动。长期以来,Autonomous Agent、Self-Evolving Agent 等概念常与长程智能体混用。

来自主题: AI技术研报
8361 点击    2026-07-26 11:28
Loss收敛不代表学会:腾讯混元ACL 2026拆解SFT训练中15.3%的“假学会”样本

Loss收敛不代表学会:腾讯混元ACL 2026拆解SFT训练中15.3%的“假学会”样本

Loss收敛不代表学会:腾讯混元ACL 2026拆解SFT训练中15.3%的“假学会”样本

SFT是LLM从“通才”变成“专才”的关键步骤。业界默认做法是:准备标注数据(QA对、指令-回复对等)在基座模型上跑SFT训练。看loss曲线收敛了→认为训练完成。但问题在于:loss是全局平均,掩盖了样本间的差异。loss收敛只代表“大部分样本学会了”——那些始终学不会的样本被淹没了。

来自主题: AI技术研报
8106 点击    2026-07-26 11:25
千万级标注成本归零!CVPR 2025清华团队成果:相机的“自运动”就是最好的老师

千万级标注成本归零!CVPR 2025清华团队成果:相机的“自运动”就是最好的老师

千万级标注成本归零!CVPR 2025清华团队成果:相机的“自运动”就是最好的老师

以往的空间音频模型,要么受限于实验室的苛刻采集条件,要么被高昂的人工标注成本卡住脖子。而团队的核心洞察是:相机的自运动本身就是一种免费的监督信号。当相机转动时,声源在声场中的相对位置随之改变——这种变化无需人工标注,模型即可从中学习空间对应关系。这项工作入选CVPR 2025 Highlight,投稿论文前2%。

来自主题: AI技术研报
7869 点击    2026-07-26 11:25
给835页文档,还你一个数据库!Cursor重塑「大模型经济学」:AI蜂群化身终极廉价编译器

给835页文档,还你一个数据库!Cursor重塑「大模型经济学」:AI蜂群化身终极廉价编译器

给835页文档,还你一个数据库!Cursor重塑「大模型经济学」:AI蜂群化身终极廉价编译器

多模型Agent系统显然是未来的趋势。cursor 的一篇很不错的文章。他们的最新研究表明,将前沿模型作为规划者和协调者,与一个更廉价的“主力”模型搭配,可以大幅降低项目中总token的成本,从而实现 15 倍的成本改进。

来自主题: AI技术研报
7831 点击    2026-07-25 11:37
Kimi K3设计榜登顶焚诀公开:就藏在思维链里

Kimi K3设计榜登顶焚诀公开:就藏在思维链里

Kimi K3设计榜登顶焚诀公开:就藏在思维链里

停停停!Kimi K3的最佳打开方式可能不在Coding——用它做前端设计,才是真·Interesting。在Design Arena最新公布的单次生成前端榜单中,Kimi K3以1414分位列第一,力压Fable 5和GPT-5.6 Sol。

来自主题: AI技术研报
9177 点击    2026-07-25 11:37
告别“无脑”长推理!腾讯E-GRM让模型学会“自我怀疑”:拿不准才多想,拿得准直接答

告别“无脑”长推理!腾讯E-GRM让模型学会“自我怀疑”:拿不准才多想,拿得准直接答

告别“无脑”长推理!腾讯E-GRM让模型学会“自我怀疑”:拿不准才多想,拿得准直接答

E-GRM的核心思路就是让模型自己判断输入复杂度——通过多次采样看答案是否收敛。收敛了就直接回答,不收敛再触发CoT。在RM-Bench、RMB、RewardBench三个基准上,约58%的样本被智能路由到“直答”,延迟降低62%,同时准确率还有提升。

来自主题: AI技术研报
8231 点击    2026-07-25 11:37
AI老大哥夯爆了,“商汤系”离职创业者这半年狂揽400亿元!

AI老大哥夯爆了,“商汤系”离职创业者这半年狂揽400亿元!

AI老大哥夯爆了,“商汤系”离职创业者这半年狂揽400亿元!

根据IT桔子数据,截至2026年7月17日, 32家“商汤系”公司在上半年共完成28笔融资,累计融资额超过470亿元人民币,在中国AI融资市场取得了耀眼的成绩。其中,既有商汤科技自身通过“1+X”战略拆分出的子公司——曦望Sunrise、大晓机器人、商汤医疗等;也有大批从商汤离职创业的前高管所创立的公司

来自主题: AI技术研报
7972 点击    2026-07-24 15:57
一个Skill为什么越改越好?腾讯SkillHone让Agent记住每次优化决策

一个Skill为什么越改越好?腾讯SkillHone让Agent记住每次优化决策

一个Skill为什么越改越好?腾讯SkillHone让Agent记住每次优化决策

腾讯微信在论文 SkillHone 中,将这个问题归结为优化历史丢失,进而提出了面向持续 Skill 进化的开发框架。 SkillHone 把每轮诊断、候选修改、评估证据和最终决定组织成持久决策历史。同时,持续优化的对象也从单一的 SKILL.md 文件扩展到了整个 Skill 文件夹及其修改过程。

来自主题: AI技术研报
8419 点击    2026-07-24 15:56
多模态大模型训练的显存与吞吐困局,被小红书开源的BigMac打破了

多模态大模型训练的显存与吞吐困局,被小红书开源的BigMac打破了

多模态大模型训练的显存与吞吐困局,被小红书开源的BigMac打破了

BigMac 是原生多模场景下的流水并行训练新范式。它针对多模态大模型训练中计算效率与显存占用难以兼顾的问题,提出了依赖安全的嵌套流水线:以成熟的 LLM 流水线为主干,在不打乱 LLM 执行顺序的前提下,有序嵌入编码器和生成器计算,从而在不增加 LLM 流水线空泡、保持激活显存有界的同时,高效实现多模态流水训练。

来自主题: AI技术研报
8115 点击    2026-07-24 15:55
把思考折叠进序列:WeLM 617B MoE的隐式Scaling路径

把思考折叠进序列:WeLM 617B MoE的隐式Scaling路径

把思考折叠进序列:WeLM 617B MoE的隐式Scaling路径

新智元报道 大模型变强,过去靠两条路。 做大——Scaling Law出现后,参数从百亿推向千亿,算力支出一路飙升。 想久——o1带火思考模型,用更长的思维链、更多推理时间换结果。 问题是,除了Sca

来自主题: AI技术研报
8213 点击    2026-07-24 15:54
真实工作流,正在成为下一代训练数据

真实工作流,正在成为下一代训练数据

真实工作流,正在成为下一代训练数据

数据市场的故事,正在进入新一轮周期。来自企业真实工作流的 Real-world Data,成为越来越多 AI Labs 争夺的新资源。比如 GitHub 就是典型的 Real-world Data,它几乎完整保留了一个问题从出现到解决的全过程。相比之下,今天绝大多数 Human Data 公司提供的,仍是人为构造的数据。

来自主题: AI技术研报
8598 点击    2026-07-24 11:00
让Agent学会「如何演化」:清华、华为提出层次化技能元演化框架HiSME

让Agent学会「如何演化」:清华、华为提出层次化技能元演化框架HiSME

让Agent学会「如何演化」:清华、华为提出层次化技能元演化框架HiSME

当大模型 Agent 被部署到工具调用、长程任务和开放环境中,一个关键问题会随之出现:能否在不更新模型参数的情况下,将执行经验沉淀下来,并在下一次做得更好?

来自主题: AI技术研报
5770 点击    2026-07-24 10:45
Workflow Gym:告别仿真测试,抹平Agent落地鸿沟

Workflow Gym:告别仿真测试,抹平Agent落地鸿沟

Workflow Gym:告别仿真测试,抹平Agent落地鸿沟

你可能已经在各种 benchmark 榜单上看过 GUI Agent 的 "大胜" 了。

来自主题: AI技术研报
6702 点击    2026-07-24 10:45