Vibe一下能自动画工程图、做3D装配的AI来了丨上海AI Lab
Vibe一下能自动画工程图、做3D装配的AI来了丨上海AI Lab近日,上海AI Lab等团队提出了一种面向专业软件智能体的新范式——ComAct(COM-as-Action)。它的核心思想在于:不再把鼠标点击和键盘输入作为Agent的action,而是让Agent直接生成COM代码,通过软件底层对象模型操纵真实专业软件。
搜索
近日,上海AI Lab等团队提出了一种面向专业软件智能体的新范式——ComAct(COM-as-Action)。它的核心思想在于:不再把鼠标点击和键盘输入作为Agent的action,而是让Agent直接生成COM代码,通过软件底层对象模型操纵真实专业软件。
vLLM 社区推出的 Semantic Router 除了专注上面三个方向,正在更进一步:我们认为:router 不只是选择模型,还可以提升模型能力。用户不用改权重,也不用让每个 Agent 团队都自己搭一套 Graph,而是在一次普通 Model API 调用的内部,组织出一支有边界、有预算、有验证、有回退的 “小队”。
今天来好好盘点 2026 年上半年的图片与视频模型,伴随模型更新时间轴出现的,还有我一些当时的测试文章。也算是对不怎么努力也没什么收获的上半年做个总结汇报了。
浙江大学等五所高校的研究团队提出 EgoTSR。研究从第一人称机器人视角出发,希望让 VLM 学会判断任务状态,并把这种能力进一步扩展到长程规划。团队构建了包含 4600 万条样本的 EgoTSR-Data,并设计了三阶段课程学习流程。
AI 创业公司「MobAI」已完成数百万元天使轮融资,由港股上市公司赤子城科技独家投资。目前,由MobAI开发的AI互动叙事应用Lunaverse Stories 已进入邀请制测试阶段。 熟悉AI互动类产品的人应该对MobAI并不陌生。
Github热榜持续屠榜,短短几天一路狂揽15.4k stars,甚至一度冲到了Top 1的位置。不是啥大厂项目,也不是啥新模型。而是一个叫OpenMontage的开源「视频制作」系统~(剪辑人狂喜.jpg)
或许是知道大家这周末都要奋战狂战 Fable 5,Anthropic 的 Claude Code 开发者 Thariq 放出了一篇长文,分享他使用 Fable 5 模型的方法论。Thariq 在文中表示:Fable 5 的能力上限,取决于你能发现多少自己还不知道的东西。
就在前几天,一家名为 Oasis Devices 的迈阿密初创公司,发布了一款专门适用于不方便打字也不方便大声说话的新 AI 录音听写硬件,OASIS 1 智能戒指。这枚售价 289 美元的钛合金戒指,最大的卖点,就是把 Wispr Flow 的 AI 听写技术,从一个放在手机上的 App 里,转到了一个离我们嘴巴更近的载体里。
“Opus是好模型,但Fable 5比它好十倍。”Alex说。他建议开发者把过去两周Fable下架期间写的所有代码,全部丢给Fable 5进行重新审查,目的是看看有没有安全漏洞、性能不够的地方、或者写得太粗糙但可以修改好的逻辑。
就在昨晚,Anthropic扔出了经济指数系列的第六份报告——第一次把几百万次Claude对话的采样精度从每周拉到逐小时!你几点焦虑、几点嘴馋、几点睡不着,全在数据里。AI比你的伴侣还懂你的作息。