还记得龙虾User.md吗「个性化」和记忆究竟能在多大程度上影响LLM的输出?UIUC评测
还记得龙虾User.md吗「个性化」和记忆究竟能在多大程度上影响LLM的输出?UIUC评测个性化在通用AI产品中一直是个加分项。无论是ChatGPT、Gemini还是Claude,还是今年的Openclaw、Harmes都把记忆和个性化当成核心卖点,理由是它能提高可用性、参与度和用户满意度。学术界对个性化的研究,也几乎全部集中在"如何做得更好、更准、更符合用户口味"上。
搜索
个性化在通用AI产品中一直是个加分项。无论是ChatGPT、Gemini还是Claude,还是今年的Openclaw、Harmes都把记忆和个性化当成核心卖点,理由是它能提高可用性、参与度和用户满意度。学术界对个性化的研究,也几乎全部集中在"如何做得更好、更准、更符合用户口味"上。
「麻烦你,帮我看一下。」
我们自建的"你画我猜 Benchmark"第一期用150个词、1350张SVG画作对8款模型进行互画互猜测试,最终GPT-6 Astra以75.5分险胜Gemini 3.8 Flash与Claude Fable 5.1,结果显示思考更多或花费更多的模型并未稳定取得更高分,且部分模型连自己的画都认不出。
谷歌Antigravity团队公布Teamwork多智能体编排框架成果,轻量级Gemini 3.7 Flash复现了Gemini 3.1 Pro解出的3道博士级数学难题,并从零构建RISC-V CPU模拟器、改进Eigen和ParlayHash开源库代码,证明小模型通过制度化博弈编排也能完成顶尖科研与工程任务。
研究发现SubAgent等上下文重建机制会将工具层的恶意指令提权为用户消息或系统指令,导致Claude Code、Codex、Gemini CLI、Qwen Code、Kimi和OpenCode六款AI编码框架在13类攻击上全部沦陷,连自动权限审核(Auto PR)也被绕过。
5个月迭代4款模型,下一步还要开源。
过去两年,AI生图的参数量与清晰度完成了指数级跨越,但真正面向服装行业却依然面临一个极其尴尬的悖论——当GPT、Gemini等顶尖大模型在通用图像生成上大放异彩时,落地到服装产业的深水区,依然满屏是令人出戏的AI味。通用的SOTA模型做得到了“逼真”,却依然做不好“商业”。
在 AI 狂飙突进的这两年里,Google 似乎总是扮演着那个「起大跑慢」的角色。
刚刚,Gemini 3.8 Flash,正式发布。
谷歌正式发布Gemini 3.8 Flash及网络安全专用版Gemini 3.8 Flash Cyber,前者以极低单任务成本在多项基准测试中逼近GPT-5.6 Sol、Grok 4.6等顶级模型,并在软件工程和速度上实现大幅跃升,后者则在漏洞发现基准CyberGym上以86.2%的成绩屠榜,谷歌DeepMind称这标志着RSI(递归自我进化)迈出了一大步。