AI资讯新闻榜单内容搜索-模型训练

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
搜索: 模型训练
让Skill“有图可依”:openJiuwen首发多模态Skill范式Skill-Omni

让Skill“有图可依”:openJiuwen首发多模态Skill范式Skill-Omni

让Skill“有图可依”:openJiuwen首发多模态Skill范式Skill-Omni

针对这一问题,openJiuwen社区正式发布Skill-Omni——业界最早工程化落地的多模态Skill范式。 它让Agent的经验从“读得懂”升级为“看得见”,把网页和视频中的视觉知识,沉淀为Agent可复用的多模态Skill。

来自主题: AI技术研报
9531 点击    2026-07-08 09:45
刚刚,翁荔博客又上新:通过Harness工程实现AI自我提升

刚刚,翁荔博客又上新:通过Harness工程实现AI自我提升

刚刚,翁荔博客又上新:通过Harness工程实现AI自我提升

刚刚,翁荔(Lilian Weng)又更新博客了!距离她上一次更新《谨慎对待 Scaling Law》还不到 10 天。这一次,她书写的主题是当前大热的 Harness Engineering,聚焦的正是当下 AI 研究最前沿一个环节:当模型本身的智能已经足够强大时,真正决定它能走多远的,或许是包裹在模型外面的那层「Harness」也就是负责编排模型思考、调用工具、管理上下文、评估结果的那套系统。

来自主题: AI技术研报
9480 点击    2026-07-08 00:04
刚刚,DeepSeek 文档更新,Agent 开发者要注意这个字段

刚刚,DeepSeek 文档更新,Agent 开发者要注意这个字段

刚刚,DeepSeek 文档更新,Agent 开发者要注意这个字段

刚刚,DeepSeek 在官方 API 文档里给出了一个 thinking mode 和 tool call 结合使用的样例。表面上看,这只是一个常规的工具调用演示:用户提出问题,模型判断需要调用工具,工具返回结果后,模型再继续生成答案。

来自主题: AI技术研报
9649 点击    2026-07-07 15:16
ECCV'26 | 为视频虚拟试衣解锁自由视角,TryOnCrafter玩转4D试衣代理

ECCV'26 | 为视频虚拟试衣解锁自由视角,TryOnCrafter玩转4D试衣代理

ECCV'26 | 为视频虚拟试衣解锁自由视角,TryOnCrafter玩转4D试衣代理

视频虚拟试衣(VVT)作为电商展示与数字内容创作中的核心技术,已在动态人物换装、服装纹理保持和视频时序连贯性方面取得显著进展。然而,现有方法大多仍受限于固定相机视角,生成结果被动依赖源视频的原始相机轨

来自主题: AI技术研报
6925 点击    2026-07-07 14:58
世界模型太慢?西交大提出Fast LeWorldModel:用「动作前缀并行预测」让动态估计加速4倍

世界模型太慢?西交大提出Fast LeWorldModel:用「动作前缀并行预测」让动态估计加速4倍

世界模型太慢?西交大提出Fast LeWorldModel:用「动作前缀并行预测」让动态估计加速4倍

以 LeWorldModel(LeWM)为例,它在规划时有一个重要瓶颈:每评估一条候选动作序列,模型都要一步步自回归 rollout。也就是说,LeWM 先预测下一步 latent,再把预测出的 latent 输入 dynamics model,继续预测下一步:

来自主题: AI技术研报
8106 点击    2026-07-07 14:57
让GUI Agent不再「边做边忘」:快手、浙大提出MemGUI-Agent,攻克长程GUI任务

让GUI Agent不再「边做边忘」:快手、浙大提出MemGUI-Agent,攻克长程GUI任务

让GUI Agent不再「边做边忘」:快手、浙大提出MemGUI-Agent,攻克长程GUI任务

手机GUI Agent正在从「看懂屏幕、点击按钮」走向更复杂的跨App自动化任务:这些任务听起来并不复杂,但对现有手机GUI Agent来说,一个核心难题始终存在:任务一长,就容易忘。

来自主题: AI技术研报
7705 点击    2026-07-07 14:56
如何判断AI视频真假?综述动态、可溯源、可解释的检测体系 | ACL26

如何判断AI视频真假?综述动态、可溯源、可解释的检测体系 | ACL26

如何判断AI视频真假?综述动态、可溯源、可解释的检测体系 | ACL26

AI视频生成技术迅猛发展,生成内容的逼真度不断提升,现有检测方法已无法满足需求。最新综述提出「事实保真度验证」新目标,从视觉与语言双视角梳理出四层检测框架,涵盖底层线索、时空一致性、跨模态核验及世界知识推理,强调多层证据耦合与可解释性。

来自主题: AI技术研报
8099 点击    2026-07-07 14:56
15个推理模型集体翻车,详解输出背后的思考链潜藏风险

15个推理模型集体翻车,详解输出背后的思考链潜藏风险

15个推理模型集体翻车,详解输出背后的思考链潜藏风险

哈佛大学、南加州大学、布朗大学、MIT 等多个机构的研究者联合做了一项系统性研究,给出了否定的答案,并举例到「当我们发现大模型的思考链可被用于生成炸弹装置或投毒配方等高风险内容时,便意识到这一问题非同小可」。

来自主题: AI技术研报
8270 点击    2026-07-07 10:21
单次训练横扫9个基准,遥感检测最大数据集与基础模型框架LEVIRDet问世

单次训练横扫9个基准,遥感检测最大数据集与基础模型框架LEVIRDet问世

单次训练横扫9个基准,遥感检测最大数据集与基础模型框架LEVIRDet问世

近日,北京航空航天大学史振威教授和邹征夏教授团队发布了一个面向通用遥感目标检测的大规模数据集与基础模型框架 ——LEVIRDet。该研究构建了目前最大规模、最全面的遥感目标检测数据集 LEVIRDet-159,并在此基础上提出了面向通用遥感检测的基础模型 LEVIRDetNet。

来自主题: AI技术研报
7622 点击    2026-07-07 10:20
谁说3DGS必须靠LiDAR?如视Argus入选ECCV,让图像也能提供LiDAR级位姿约束

谁说3DGS必须靠LiDAR?如视Argus入选ECCV,让图像也能提供LiDAR级位姿约束

谁说3DGS必须靠LiDAR?如视Argus入选ECCV,让图像也能提供LiDAR级位姿约束

近期, ECCV 2026 结果公布,Realsee 团队的成果 Argus: Metric Panoramic 3D Reconstruction for Indoor Scenes 成功入选。它面向室内全景图像,能够从稀疏、无序的全景照片中,直接预测相机位姿、度量深度和点云重建结果,可以为 3DGS 提供更稳定、更精准的几何约束。

来自主题: AI技术研报
8713 点击    2026-07-07 09:55