AI资讯新闻榜单内容搜索-多模态

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
搜索: 多模态
刚刚,字节最强图像模型杀回来了!17个案例深度实测Seedream 5.0 Pro

刚刚,字节最强图像模型杀回来了!17个案例深度实测Seedream 5.0 Pro

刚刚,字节最强图像模型杀回来了!17个案例深度实测Seedream 5.0 Pro

7月8日晚间,字节跳动Seed团队正式发布多模态图像创作模型Seedream 5.0 Pro。这距离今年2月10日Seedream 5.0预览版上线,已经过去近5个月。相比此前版本,Seedream 5.0 Pro在图文匹配、结构合理性、文字渲染与画面美感等基础能力上进行了升级,并重点强化了四项核心能力

来自主题: AI资讯
9946 点击    2026-07-09 09:51
姚顺雨的OpenAI前同事田永龙,也加入腾讯了

姚顺雨的OpenAI前同事田永龙,也加入腾讯了

姚顺雨的OpenAI前同事田永龙,也加入腾讯了

智东西获悉,OpenAI前研究员田永龙(Yonglong Tian)已确认于近期加入腾讯大语言模型部,后续将参与VLM(视觉语言模型)相关研发。在OpenAI期间,田永龙曾参与GPT-5的研发工作。加入OpenAI之前,他在Google Research和DeepMind长期从事视觉表征学习和对比学习等方向研究,对后续视觉模型以及多模态表征学习的发展产生了广泛影响。

来自主题: AI资讯
9224 点击    2026-07-08 16:05
让Skill“有图可依”:openJiuwen首发多模态Skill范式Skill-Omni

让Skill“有图可依”:openJiuwen首发多模态Skill范式Skill-Omni

让Skill“有图可依”:openJiuwen首发多模态Skill范式Skill-Omni

针对这一问题,openJiuwen社区正式发布Skill-Omni——业界最早工程化落地的多模态Skill范式。 它让Agent的经验从“读得懂”升级为“看得见”,把网页和视频中的视觉知识,沉淀为Agent可复用的多模态Skill。

来自主题: AI技术研报
9827 点击    2026-07-08 09:45
推荐 5 款免费开源,零基础 DIY 智能 AI 桌面机器人,适配DeepSeek,豆包,Qwen大模型(附开源地址)

推荐 5 款免费开源,零基础 DIY 智能 AI 桌面机器人,适配DeepSeek,豆包,Qwen大模型(附开源地址)

推荐 5 款免费开源,零基础 DIY 智能 AI 桌面机器人,适配DeepSeek,豆包,Qwen大模型(附开源地址)

乐鑫喵伴 EchoEar EchoEar 喵伴 AI 机器人搭载的 ESP-Brookesia 框架实现全双工语音交互、多模态识别与智能体控制,构建更具沉浸感的人机交互体验。 EchoEar 套件以端

来自主题: AI资讯
10475 点击    2026-07-06 11:06
把 Kimi 接进 Codex ,小白用 Agent 的最好选择

把 Kimi 接进 Codex ,小白用 Agent 的最好选择

把 Kimi 接进 Codex ,小白用 Agent 的最好选择

如果是小白第一次上手,我会更建议从 Kimi 开始。Kimi 的中文理解、长文本处理、Coding、多模态综合能力都很强,是最适合 Codex 的国产模型。今天这篇内容,手把手教大家如何将第三方大模型接入 Codex 搞定日常任务。

来自主题: AI资讯
10810 点击    2026-07-05 11:05
只用15%数据,多模态指令微调反超全量训练15.8%!

只用15%数据,多模态指令微调反超全量训练15.8%!

只用15%数据,多模态指令微调反超全量训练15.8%!

来自上海交大、马来亚大学、CMU、MBZUAI、KIT和KAUST的团队提出VisNec(Visual Necessity Score,视觉必要性分数),用一个分数衡量每条训练样本里“图像到底起了多大作用”,被ECCV 2026收录。

来自主题: AI技术研报
8338 点击    2026-07-04 10:47
Google「白送」开发者每分钟 100 万 tokens?12 万人围观后,真相让人五味杂陈

Google「白送」开发者每分钟 100 万 tokens?12 万人围观后,真相让人五味杂陈

Google「白送」开发者每分钟 100 万 tokens?12 万人围观后,真相让人五味杂陈

0 美元你能得到什么——Gemini 2.5 Flash 和 Pro 均可用,每分钟 1M tokens,原生支持文本、图像、音频、视频多模态输入 ,几秒钟生成 API Key,即开即用

来自主题: AI资讯
11714 点击    2026-06-30 13:56
给Transformer变个形,LLM竟能变得更聪明

给Transformer变个形,LLM竟能变得更聪明

给Transformer变个形,LLM竟能变得更聪明

2026 年 6 月,大模型行业正在经历一场前所未有的「开源海啸」:英伟达放出了 550B 参数的混合架构模型,谷歌送出多模态的 Gemma 新版本,智谱用最宽松的协议全量开源了自家旗舰模型。

来自主题: AI技术研报
8541 点击    2026-06-30 10:20