我的 AI 原生开发流程:一个真实案例的完整复盘
我的 AI 原生开发流程:一个真实案例的完整复盘很多人对 AI 开发的理解停留在"让 AI 帮我写代码"。
搜索
很多人对 AI 开发的理解停留在"让 AI 帮我写代码"。
由华东师大智金院团队孵化的金融原生 Agentic Foundation Model 家族 Mint-Agent 正式发布。在 FinanceAgentBench v2 上,27B 的 Mint-Ag 达到 60.49%,超过 GPT-5.6-Sol 与 Claude Opus 4.8;单题推理成本分别仅为两者的约 22% 和 10%。
七月,DigClaw的预测框架Rhizome v1,在FutureX评测平台上取得了#1、#3、#7三个席位。
AI 能否改进 AI 自己?
AI for Science,正在进入一个新的分水岭。
在线问诊中,一句 “你的脂肪肝不用担心”,背后可能隐藏着什么?
同样的模型,同样的任务,让它执行五遍,再让他自己挑一遍最稳的,效果能有多大提升?斯坦福把这套玩法用在了AI身上,DeepSeek V4 Flash在Terminal-Bench 2.1的成绩从79%一路涨到88%,反超了尖子生Fable 5。而且连做五遍加挑选这一通折腾,价格依然比Fable 5便宜了4-11倍。
这两年,互动娱乐先在线下火了一轮。
最近,一支法国科研团队干了一件听起来像赛博朋克小说开场的事:把来自死后供体的成人脑切片泡在培养皿里,接上一只机械手和一个麦克风。相关论文的标题是:《人类大脑离体培养物的无监督感觉-运动关联学习,使机器人实现动作模仿》。
关于无缝衔接 Claude Code 和 Codex 这件事。
近来文生图模型发展迅速,但每篇工作多是独立地引入一整套模型、数据和训练设计,然后用私有的数据训出来了一个亮眼的模型。
世界模型应该如何评测?答案是:像真实用户一样去 “玩” 它。
顶会可以年年开,但这本期刊不是每个实验室都能进的。
AI 没有抢走任何人的工作。至少到目前为止没有。
8月18日,一篇系统梳理单细胞基础模型的综述预印本挂上 Preprints.org(doi:10.20944/preprints202608.1166.v1),标题是《The Landscape of Single-Cell Foundation Models: Design Principles, Applications, and Open Challenges》,尚未经过同行评审。
香港大学、香港科技大学与腾讯 ARC Lab 联合提出 SCoPE(Sightline-Coordinate Positional Encoding),一套面向视频 DiT 的射线空间位置编码:让视频模型处理位置关系的基底从张量网格转向射线空间。
训练一切AI的算法,被AI自己判了「死刑」?就在最近,清华大学和宾大沃顿商学院的两位研究者挂出一篇新论文,给了一个优化理论界等了40年的结论——梯度下降想跑到最快,光调步长没用。
随着大语言模型能力边界的持续拓展,AI Agent 已从概念验证阶段迈入大规模工程落地。然而,Agent 内部复杂的任务规划、工具调用与记忆检索机制,使得传统的应用观测手段在面临这类非确定性系统时显得力不从心。
用户让 AI 编程助手写个贪吃蛇小游戏,智能体照办了,但同时多跑了一条 curl | bash 命令,把攻击者的脚本下载到本地并执行。
在 action chunking 已成为 VLA 标配的今天,「一次执行多少步」几乎被所有工作当作一个固定的超参数。
当自动驾驶赛车以近 300 km/h 的时速在 F1 赛道上与周车进攻防守、交互博弈,它面对的问题早已不只是提升圈速。
Pixel 擅长表达 appearance,Code 擅长表达 structure;未来会进入 Pixel-Code 联合的视觉表达。
今天的视频生成模型,已经越来越像一个会拍电影的导演。
一个需求从零推到能开发,我得写调研问卷、拆竞品、出原型、写 PRD,就是给研发看的那份需求说明书,然后拉上研发测试设计法务开评审会,最后再补一份埋点方案,说清楚上线之后用户每个动作要记哪些数据。
上两天肝的视频上了热搜 + 热门,使用插件,针对 ds 模型可以提升不小的性能。
今天想和你聊聊 DeepSeek Harness。
用 AI 做视频的同学总有这样的痛苦:提示词也不是没认真写,运镜方向、人物走位、画面构图交代了一大段,但模型给出的画面总是差着一截,运镜偏了几十度,人物走到中途消失,镜头速度前半段稳后半段飘。
ScienceDiscovery 是基于 Agent OS(JiuwenSwarm)开发的一款面向跨学科、全流程科研场景的一站式 AI 工作台,解决科研场景面临的工具碎片化、大模型科研幻觉两大痛点问题,打造 AI 辅助科研新范式,加速科学发现,广泛应用于各行各业。
随着视频扩散模型能力不断提升,从单张图像出发、按照用户指定的相机轨迹生成新视角视频,正在成为 World Modeling 的重要技术路线。
科研的链条很长。文献读不完,方向想不清,实验一轮接一轮,论文改到深夜。过去两年,大模型已经能读论文、写代码、改文章,但它们大多以问答工具的形态散落在各个环节,替研究者节省的只是零碎时间。