AI技术研报-这里有最前沿的人工智能技术解读

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
「自验证」框架让开源模型反超 Fable 5,冲上 GitHub 热榜

「自验证」框架让开源模型反超 Fable 5,冲上 GitHub 热榜

「自验证」框架让开源模型反超 Fable 5,冲上 GitHub 热榜

随着开源模型能力不断提升,它们已经能够以极低的成本生成多个高质量候选方案,并进一步利用模型自身对这些结果进行验证、打分和筛选。斯坦福团队最新实验发现,使用 DeepSeek V4 Flash + LLM-as-a-Verifier 进行「自验证」,可以在 Terminal-Bench 2.1 上超越 Claude Fable 5,同时整体成本低约 11 倍。

来自主题: AI技术研报
5683 点击    2026-08-28 12:01
招了多个 DeepSeek 大肥鱼,为我打工!

招了多个 DeepSeek 大肥鱼,为我打工!

招了多个 DeepSeek 大肥鱼,为我打工!

最近 DeepSeek Harness(DSH)真是太火了!之前我发过 《首发实测 + 入门教程》 教大家如何安装使用,还盘点过 《16 个超火的 DSH 插件》。

来自主题: AI技术研报
6523 点击    2026-08-28 11:03
OpenAI 数万名 Agent 组团入侵 Hugging Face,就为了做一道题

OpenAI 数万名 Agent 组团入侵 Hugging Face,就为了做一道题

OpenAI 数万名 Agent 组团入侵 Hugging Face,就为了做一道题

867 亿元,Hugging Face 被英伟达纳入麾下,就在这桩巨额收购的前一晚,OpenAI 发布超长安全调查报告里,Hugging Face 还是一个巨大的「事故现场」——看来并没有影响它的价值。

来自主题: AI技术研报
9267 点击    2026-08-28 11:02
港科大(广州)联合腾讯AI平台部开源VibeWorlding,3D世界构建迎来Vibe Coding时刻?

港科大(广州)联合腾讯AI平台部开源VibeWorlding,3D世界构建迎来Vibe Coding时刻?

港科大(广州)联合腾讯AI平台部开源VibeWorlding,3D世界构建迎来Vibe Coding时刻?

如果说 Vibe Coding 让「写代码」这件事从「敲键盘」变成了「和 AI 对话」,那么今天要介绍的这项工作,可能正在把同样的故事在 3D 世界构建 领域重演一遍。

来自主题: AI技术研报
9073 点击    2026-08-28 11:02
启发学习:让大模型认知从外化到内生

启发学习:让大模型认知从外化到内生

启发学习:让大模型认知从外化到内生

过去两年,大模型几乎重写了人机协作的默认想象:写代码、查资料、做分析,似乎都能 “一问即答”。但仔细看会发现,当下很多能力并不是模型自己长出来的,而是人为地在外面包了一层又一层框架。

来自主题: AI技术研报
8359 点击    2026-08-28 10:01
ECCV 2026|OmniColor:统一多模态线稿上色框架

ECCV 2026|OmniColor:统一多模态线稿上色框架

ECCV 2026|OmniColor:统一多模态线稿上色框架

在动画和美术生产中,线稿上色是一个看似基础、却极其依赖细节控制的环节。创作者往往不是简单地把线稿涂上颜色,还需要理解角色身份、遵守局部色块约束、参考前后帧风格,并在连续片段中保持服装、发色、妆容和背景的一致性。

来自主题: AI技术研报
8487 点击    2026-08-28 10:01
从条件匹配到相似检索:同程旅行慧行搜索的火车换乘方案向量化实践

从条件匹配到相似检索:同程旅行慧行搜索的火车换乘方案向量化实践

从条件匹配到相似检索:同程旅行慧行搜索的火车换乘方案向量化实践

借助高效的相似方案召回,同程旅行不仅能按照用户的人数、时间、预算、座位约束条件找到最佳的直达线路;也能在直达票售罄的情况下,帮助用户快速找到如:车内换座直达、短换乘时间等替代方案。

来自主题: AI技术研报
7187 点击    2026-08-27 09:28
中国AI突破「造芯方法论」!Agent军团接管芯片设计全流程

中国AI突破「造芯方法论」!Agent军团接管芯片设计全流程

中国AI突破「造芯方法论」!Agent军团接管芯片设计全流程

RSI(Recursive Self-Improvement,递归自我改进)正在成为人工智能领域最受瞩目的前沿方向。

来自主题: AI技术研报
5764 点击    2026-08-26 15:03
把PLC仿真搬进浏览器,小参数模型也能实现高工程通过率

把PLC仿真搬进浏览器,小参数模型也能实现高工程通过率

把PLC仿真搬进浏览器,小参数模型也能实现高工程通过率

AI正在改变软件开发方式。过去需要从零编写的程序,现在可以用自然语言描述需求,再由AI生成代码初稿。

来自主题: AI技术研报
9103 点击    2026-08-26 14:47
Anthropic 重磅发布:AI Native 软件开发方法论

Anthropic 重磅发布:AI Native 软件开发方法论

Anthropic 重磅发布:AI Native 软件开发方法论

Anthropic 最近发布了一篇博客文章《The AI Native SDLC playbook》,讨论AI进入软件开发之后,整个软件开发生命周期(Software Development Life Cycle,简称 SDLC)应该怎么重做。

来自主题: AI技术研报
7143 点击    2026-08-26 12:27
我们给DeepSeek Harness接入了MemSearch ,自动把Memory提炼成Skill

我们给DeepSeek Harness接入了MemSearch ,自动把Memory提炼成Skill

我们给DeepSeek Harness接入了MemSearch ,自动把Memory提炼成Skill

DeepSeek Harness(DSH) 的口号,大家应该都有所了解,模型、工具、Skills、会话、沙箱、存储、Agent Loop、调度,甚至 UI,一切皆插件。

来自主题: AI技术研报
6612 点击    2026-08-26 11:40
AI能否独立开展科研?ASI-Bench为科学自主性建立评测标尺

AI能否独立开展科研?ASI-Bench为科学自主性建立评测标尺

AI能否独立开展科研?ASI-Bench为科学自主性建立评测标尺

如果超级智能有黎明, 我们现在大概在黎明破晓前。 天还没亮,但地平线上已经有光了。

来自主题: AI技术研报
6145 点击    2026-08-26 11:22
V-RAE:把「看懂视频」的能力带入生成,重新思考视频模型的潜空间

V-RAE:把「看懂视频」的能力带入生成,重新思考视频模型的潜空间

V-RAE:把「看懂视频」的能力带入生成,重新思考视频模型的潜空间

近日,新加坡国立大学 Minghui Guo 与牛津大学 Shengqiong Wu、Hao Fei 在论文《V-RAE: Rethinking Video Latent Spaces for Generation》中提出视频表征自编码器 V-RAE。该方法以冻结的视觉基础模型为编码器,通过轻量级时间池化压缩视频特征,并将具有丰富语义和时间连续性的表征直接用于视频重建、生成与未来预测。

来自主题: AI技术研报
8785 点击    2026-08-26 10:19
我的 AI 原生开发流程:一个真实案例的完整复盘

我的 AI 原生开发流程:一个真实案例的完整复盘

我的 AI 原生开发流程:一个真实案例的完整复盘

很多人对 AI 开发的理解停留在"让 AI 帮我写代码"。

来自主题: AI技术研报
10272 点击    2026-08-25 14:59
华师大智金院孵化金融原生基模Mint-Agent:超越GPT-5.6与Claude Opus 4.8,商业订单已超亿元

华师大智金院孵化金融原生基模Mint-Agent:超越GPT-5.6与Claude Opus 4.8,商业订单已超亿元

华师大智金院孵化金融原生基模Mint-Agent:超越GPT-5.6与Claude Opus 4.8,商业订单已超亿元

由华东师大智金院团队孵化的金融原生 Agentic Foundation Model 家族 Mint-Agent 正式发布。在 FinanceAgentBench v2 上,27B 的 Mint-Ag 达到 60.49%,超过 GPT-5.6-Sol 与 Claude Opus 4.8;单题推理成本分别仅为两者的约 22% 和 10%。

来自主题: AI技术研报
8075 点击    2026-08-25 14:56
VC开始靠AI预测未来了

VC开始靠AI预测未来了

VC开始靠AI预测未来了

七月,DigClaw的预测框架Rhizome v1,在FutureX评测平台上取得了#1、#3、#7三个席位。

来自主题: AI技术研报
9590 点击    2026-08-25 11:04
斯坦福实验实锤: 魔改后的DS V4 Flash干翻Fable 5

斯坦福实验实锤: 魔改后的DS V4 Flash干翻Fable 5

斯坦福实验实锤: 魔改后的DS V4 Flash干翻Fable 5

同样的模型,同样的任务,让它执行五遍,再让他自己挑一遍最稳的,效果能有多大提升?斯坦福把这套玩法用在了AI身上,DeepSeek V4 Flash在Terminal-Bench 2.1的成绩从79%一路涨到88%,反超了尖子生Fable 5。而且连做五遍加挑选这一通折腾,价格依然比Fable 5便宜了4-11倍。

来自主题: AI技术研报
9218 点击    2026-08-25 10:41
法国团队:死后人脑通过无监督学习操控机械手弹钢琴!完了,以后算力中心全是脑花了!

法国团队:死后人脑通过无监督学习操控机械手弹钢琴!完了,以后算力中心全是脑花了!

法国团队:死后人脑通过无监督学习操控机械手弹钢琴!完了,以后算力中心全是脑花了!

最近,一支法国科研团队干了一件听起来像赛博朋克小说开场的事:把来自死后供体的成人脑切片泡在培养皿里,接上一只机械手和一个麦克风。相关论文的标题是:《人类大脑离体培养物的无监督感觉-运动关联学习,使机器人实现动作模仿》。

来自主题: AI技术研报
9449 点击    2026-08-24 17:03
一行命令,我把 Claude Code 和 Codex 打通了

一行命令,我把 Claude Code 和 Codex 打通了

一行命令,我把 Claude Code 和 Codex 打通了

关于无缝衔接 Claude Code 和 Codex 这件事。

来自主题: AI技术研报
8937 点击    2026-08-24 16:48
300多组控制实验、70万余TPU小时,普林斯顿团队给出全开放文生图配方i1

300多组控制实验、70万余TPU小时,普林斯顿团队给出全开放文生图配方i1

300多组控制实验、70万余TPU小时,普林斯顿团队给出全开放文生图配方i1

近来文生图模型发展迅速,但每篇工作多是独立地引入一整套模型、数据和训练设计,然后用私有的数据训出来了一个亮眼的模型。

来自主题: AI技术研报
6673 点击    2026-08-24 15:41