AI资讯新闻榜单内容搜索-扩散模型

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
搜索: 扩散模型
AI视觉创作总差点意思?中科大等综述500+篇文献,系统分析生成一致性

AI视觉创作总差点意思?中科大等综述500+篇文献,系统分析生成一致性

AI视觉创作总差点意思?中科大等综述500+篇文献,系统分析生成一致性

扩散模型已经越来越会「画」,却还远没有学会「守住要求」。决定系统是否可靠的,已不再只是画质,而是生成结果能否持续遵守条件、维持状态,并符合人类与现实世界的基本标准。

来自主题: AI技术研报
5385 点击    2026-07-02 11:04
腾讯混元最新开源:一套RL框架打通多个模态,庞天宇团队新作

腾讯混元最新开源:一套RL框架打通多个模态,庞天宇团队新作

腾讯混元最新开源:一套RL框架打通多个模态,庞天宇团队新作

大语言模型的RL技术已日趋成熟,多模态生成模型的强化学习训练却仍在“各自为战”——图像扩散模型一套流程、视频生成另一套标准、VLM和LLM又有不同的技术栈。

来自主题: AI技术研报
7194 点击    2026-06-18 11:25
Mythos阴影里谷歌悄悄发模型DiffusionGemma,速度暴涨4倍

Mythos阴影里谷歌悄悄发模型DiffusionGemma,速度暴涨4倍

Mythos阴影里谷歌悄悄发模型DiffusionGemma,速度暴涨4倍

就在刚刚,谷歌闷头干了件大事:把生成图片的扩散模型,拿来写文字了,而且一出手就是4倍加速。 新模型名为DiffusionGemma,它直接抛弃了传统自回归那套“逐Token生成”的打字机模式,而是像“印刷机”一样工作——

来自主题: AI资讯
8664 点击    2026-06-11 15:27
扩散模型里的噪声,原来还有这样的作用:DRDD重新定义统一图像翻译

扩散模型里的噪声,原来还有这样的作用:DRDD重新定义统一图像翻译

扩散模型里的噪声,原来还有这样的作用:DRDD重新定义统一图像翻译

在图像到图像翻译(Image-to-Image Translation, I2I)这个任务上,扩散模型过去几年几乎形成了一套默认逻辑:先把输入图像和噪声混合,再一步步去噪,把目标图像 “还原” 出来。

来自主题: AI技术研报
9955 点击    2026-06-10 15:15
ICML 2026|文生图模型也会「忘词」?复旦创智等提出Prompt Reinjection,无需训练提升文生图指令遵循能力

ICML 2026|文生图模型也会「忘词」?复旦创智等提出Prompt Reinjection,无需训练提升文生图指令遵循能力

ICML 2026|文生图模型也会「忘词」?复旦创智等提出Prompt Reinjection,无需训练提升文生图指令遵循能力

近年来,文生图模型的能力快速提升。从 Stable Diffusion 到 FLUX、Qwen-Image,扩散模型已经能够生成高质量图像,也能处理越来越复杂的文本提示。

来自主题: AI技术研报
9575 点击    2026-06-09 10:02
DiffusionOPD:复旦联合通义万相提出扩散模型「在线策略蒸馏」新范式,让学⽣模型同时学会构图、⽂字与美学

DiffusionOPD:复旦联合通义万相提出扩散模型「在线策略蒸馏」新范式,让学⽣模型同时学会构图、⽂字与美学

DiffusionOPD:复旦联合通义万相提出扩散模型「在线策略蒸馏」新范式,让学⽣模型同时学会构图、⽂字与美学

近期,来自复旦大学与阿里巴巴通义万相的研究团队对此提出了新的思考。他们认为,多任务强化学习不应被视为一个统一优化问题,而应该解耦为两个彼此独立的过程:单任务的在线策略探索 & 多任务能力整合。

来自主题: AI技术研报
8475 点击    2026-05-30 10:49
画数独、烧蜡烛都不翻车了?浙大&阿里让AI先三思再下笔|ACL 2026

画数独、烧蜡烛都不翻车了?浙大&阿里让AI先三思再下笔|ACL 2026

画数独、烧蜡烛都不翻车了?浙大&阿里让AI先三思再下笔|ACL 2026

当下视觉生成正陷入一个能力错位困境—— 扩散模型的像素画质已接近完美,但一遇到需要逻辑推理的生成任务就频频翻车。

来自主题: AI技术研报
6135 点击    2026-05-26 14:58