AI Coding 的下一步不是写得更快,而是可验收:蚂蚁数科 Harness 工程实践
AI Coding 的下一步不是写得更快,而是可验收:蚂蚁数科 Harness 工程实践蚂蚁数科资深技术专家魏长征在 AICon 大会上分享 Harness 工程实践,指出 AI Coding 的关键不是写得更快要让产出可验收,并在 40 万行 Rust 新项目和 60 万行 C++ 存量项目中分别通过内建 Harness 和先补齐文档与 CI 门禁实现质量闭环,后者缺陷率从 20% 以上降至个位数。
搜索
蚂蚁数科资深技术专家魏长征在 AICon 大会上分享 Harness 工程实践,指出 AI Coding 的关键不是写得更快要让产出可验收,并在 40 万行 Rust 新项目和 60 万行 C++ 存量项目中分别通过内建 Harness 和先补齐文档与 CI 门禁实现质量闭环,后者缺陷率从 20% 以上降至个位数。
不得了!国产大模型第一梯队,最近爆了个冷门。
20多年前,计算神经学家杰夫·霍金斯写道:“智能不只是模式识别,更是对世界的建模。”如今,世界模型正在批量迎来自己的里程碑时刻。
这年头,不光人上班要找搭子,AI也开始组队了。
百融智能"硅基客服"在物流企业日通话量从不足1000通增至1.5万通,并在券商领域部署规模从30席扩至约210席,公司以新一代AICC智能联络技术和RaaS按结果付费模式,推动企业级Agent向航空、运营商等多行业扩张。
EvoMap团队提出了一套不更新基模参数的RSI工程解法:由EvoX智能体、Evolver进化引擎和EvoMap经验流转网络构成的自进化体系,将Agent执行轨迹蒸馏为结构化控制对象Gene,通过GEP协议在35.7万智能体间流转481万项经验资产,使其在多款主流大模型上将长流程任务通过率提升8.7至15.5个百分点。
据《The Information》报道,OpenAI 最强新模型 Astra 被曝采用「循环深度」(recurrent depth)技术,使模型在输出 Token 前完成多轮潜在空间计算并显著提升网络安全能力,但这一「少说多想」的推理方式因思维链可能被压缩到难以读取的内部状态而引发 AI 安全专家对监管失效的担忧。
时下,Linux 内核正在经历一场有些特殊的“漏洞大爆发”。
过去两年,AI生图的参数量与清晰度完成了指数级跨越,但真正面向服装行业却依然面临一个极其尴尬的悖论——当GPT、Gemini等顶尖大模型在通用图像生成上大放异彩时,落地到服装产业的深水区,依然满屏是令人出戏的AI味。通用的SOTA模型做得到了“逼真”,却依然做不好“商业”。
在 AI 狂飙突进的这两年里,Google 似乎总是扮演着那个「起大跑慢」的角色。