拒绝「差不多」,电商模型测评迎来「最严厉的父亲」
拒绝「差不多」,电商模型测评迎来「最严厉的父亲」测评 AI 这件事,如今越来越难做了。
搜索
测评 AI 这件事,如今越来越难做了。
你有多少工作,是需要「外包」出去做的,比如交给同事或者实习生?
日产7.5万首,播放却不到3%。
过去几年,大模型推理系统优化的核心目标一直围绕一个问题展开:如何让 GPU 更高效地计算权重、激活、KV Cache 等高维张量?从并行策略、请求调度、显存管理到算子优化,学界业界大量优化技术不断提升模型推理效率。
上周我去参加了 WorkOS 在旧金山 Regency Ballroom 举办的 Agent Night Live。说实话,这类活动我参加过不少,很多时候走进去,走出来,脑子里留下的东西并不多。
义父不愧是义父!
OpenAI接连放大招!今天,一条OpenAI内部Slack消息爆出,ChatGPT将迎来一次「史诗级」的性能大换血。从硬核测试数据来看,这次ChatGPT前端性能的优化幅度,夸张到近乎「不真实」:应用加载速度直接飙升94%,堆内存增长减少87.8%,整体内存占用砍掉41.2%。
太猛了,DeepSeek Harness 截至当前已经 112 k 的 Star 了,而这距发布仅仅过去三天。而且还在以惊人的速度增长...DeepSeek Harness 的核心就是:一切皆插件。说个不确切的比喻,有点 Agent 时代的 Obsidian 感觉了,自由度太高了。
据路透社 8 月 14 日独家报道,苹果已经针对中国市场训练了一款大型语言模型。三名知情人士透露,这款模型由苹果与阿里巴巴共同开发,阿里还为模型训练提供了支持。苹果和阿里均未回应置评请求。 随着新 iPhone 已经进入发布倒计时,中国用户也不免再次关心起这个问题:国行 Apple Intelligence 到底能不能用?
DeepSeek-v4-pro-0813 正式上线,两极分化的口碑却让人摸不着头脑。一边,是疯狂刷屏的评测夯爆了:多项 Agent 测试逼近 Fable 5,被认为是又一次前沿模型的“核弹级”更新;另一边,却是不少深夜忠实开发者直摇头:吐槽涨价、模型能力不及预期,实测体感甚至不如之前的小模型……