AI资讯新闻榜单内容搜索-预训练

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
搜索: 预训练
假如有一万张卡,RL训练该怎么扩大规模?十万张呢?

假如有一万张卡,RL训练该怎么扩大规模?十万张呢?

假如有一万张卡,RL训练该怎么扩大规模?十万张呢?

当预训练将大模型带到新的能力起点,强化学习则通过持续的探索与反馈,不断激发模型在新环境、新任务中的推理与行动能力,决定它们还能走多远。

来自主题: AI技术研报
7572 点击    2026-09-22 14:43
预训练Token消耗直接腰斩!上海AI Lab&上交大提出全新预训练任务,开源首个8.9B隐空间大模型NCP-ArchPreview

预训练Token消耗直接腰斩!上海AI Lab&上交大提出全新预训练任务,开源首个8.9B隐空间大模型NCP-ArchPreview

预训练Token消耗直接腰斩!上海AI Lab&上交大提出全新预训练任务,开源首个8.9B隐空间大模型NCP-ArchPreview

自现代大模型诞生以来,“下一个Token预测(Next-Token Prediction, NTP)”就被奉为不可撼动的黄金律条。然而,逼着模型逐字死记硬背,真能学会宏观语义规划吗?

来自主题: AI技术研报
7280 点击    2026-09-22 11:18
刚刚,机器人首次「空手闯进」 30 个陌生家庭,进门就干活

刚刚,机器人首次「空手闯进」 30 个陌生家庭,进门就干活

刚刚,机器人首次「空手闯进」 30 个陌生家庭,进门就干活

Figure AI发布新一代模型Helix 2.5,在30个从未采集过数据的湾区民宅中进行零样本测试,420次试验成功237次,零样本成功率达56%,较未经Index预训练的策略的9%提升超过522%。

来自主题: AI资讯
8335 点击    2026-09-19 10:59
Gemini 4 Pro提前泄露,2M上下文?

Gemini 4 Pro提前泄露,2M上下文?

Gemini 4 Pro提前泄露,2M上下文?

用户在Code Arena的battle模式中发现疑似Gemini 4 Pro新检查点(内部代号argon)伪装为gemini-3.8-flash进行盲测,据爆料其支持256K最大输出和2M上下文窗口,原定9月发布的Gemini 4 Pro已因预训练问题推迟至10月。

来自主题: AI资讯
9212 点击    2026-09-17 17:09
独家丨BAT 天价挖 Gemini 大牛,可惜都挖错了

独家丨BAT 天价挖 Gemini 大牛,可惜都挖错了

独家丨BAT 天价挖 Gemini 大牛,可惜都挖错了

据雷峰网独家获悉,一位长期在英国工作的Google Gemini预训练专家(L7-L8级别)近期加入国内某互联网大厂,被视为本轮BAT高价争抢Gemini人才以来首次"找对了人";此前多家大厂虽从Gemini硅谷办公室挖角,但因Google有意将核心预训练人才留在DeepMind英国办公室,导致此前引入的部分人选并未触及预训练核心环节。

来自主题: AI资讯
10138 点击    2026-09-14 20:43
万卡国产训推之后,科大讯飞开始让AI反哺算力

万卡国产训推之后,科大讯飞开始让AI反哺算力

万卡国产训推之后,科大讯飞开始让AI反哺算力

9月7日科大讯飞发布星火X2.5模型,基于万卡国产910B集群完成预训练和后训练,并使其具备在真实NPU环境中自主优化算子的能力,通过DSA算子案例经约1600次工具调用实现3.5倍加速,形成AI反哺国产算力的技术闭环。

来自主题: AI资讯
8456 点击    2026-09-11 15:59
全扩散架构、无需图文对预训练,LLaDA杀穿开源文生图

全扩散架构、无需图文对预训练,LLaDA杀穿开源文生图

全扩散架构、无需图文对预训练,LLaDA杀穿开源文生图

先学会画,再学会听话。 LLaDA-Image 在预训练和中期训练阶段直接从图片学习视觉先验,超过 90% 的累计生成训练样本采用 image-only 监督;图文对则集中用于后续语言对齐。模型权重、训练代码和完整配方同步开放。

来自主题: AI技术研报
6403 点击    2026-09-08 11:02
开发者要基座模型,蚂蚁真给了!6大训练关键节点同步开源

开发者要基座模型,蚂蚁真给了!6大训练关键节点同步开源

开发者要基座模型,蚂蚁真给了!6大训练关键节点同步开源

百灵为开发者提供了多个可继续训练的起点。今日,蚂蚁百灵开源Ling-3.0-tiny-base和Ling-3.0-flash-base。除最终Base模型权重外,团队还同步开放了两款模型的预训练和中期训练权重,共计6个checkpoints。

来自主题: AI资讯
9860 点击    2026-08-21 11:16
字节Seed架构迎来重大调整

字节Seed架构迎来重大调整

字节Seed架构迎来重大调整

近期,字节跳动大模型核心部门Seed完成新一轮组织调整,调整核心集中在Seed Foundation Model(Seed基础模型)板块,新设四个一级部门,重构了预训练数据、强化学习与后训练的组织链路。

来自主题: AI资讯
9579 点击    2026-08-21 09:08
ECCV 2026|自驾VLA Scaling有戏了,北航清华DriveTeach-VLA:用图像轨迹打通驾驶场景与基模预训练

ECCV 2026|自驾VLA Scaling有戏了,北航清华DriveTeach-VLA:用图像轨迹打通驾驶场景与基模预训练

ECCV 2026|自驾VLA Scaling有戏了,北航清华DriveTeach-VLA:用图像轨迹打通驾驶场景与基模预训练

本文主要介绍来自该团队的最新论文 Teaching Vision-Language-Action Models What to See and Where to Look,目前该论文已经被 ECCV 2026 正式接收,相关代码和模型已全部开源。

来自主题: AI技术研报
8546 点击    2026-08-11 10:22