至知研究院提出大模型可解释性新路线:直接拆权重,数据成本不到1%
至知研究院提出大模型可解释性新路线:直接拆权重,数据成本不到1%大模型机制可解释性研究中,一直存在一个颇具反差的现实: 为了理解一个已经训练好的模型,研究者往往需要先训练一套新的稀疏表示。
搜索
大模型机制可解释性研究中,一直存在一个颇具反差的现实: 为了理解一个已经训练好的模型,研究者往往需要先训练一套新的稀疏表示。
大模型的版本告一段落,AI应用的新版本已经到来。
「套壳」是 Cherry Studio 最大的标签。但这个「壳」,在过去一年成了 GitHub 上增长最快的 AI 桌面应用之一。Cherry Studio 最初的目标很明确,就是帮用户在不同大模型之间自由切换,做一个更好用的聊天客户端。
端到端策略模型在物理世界频频失灵,研究者转向 “大模型智能体 + 工具调用” 自救,试图在动态物理世界中持续学习。然而,这条在线学习路径在物理世界仍未真正走通。
面对大模型规模与硬件内存之间高达20倍的算力鸿沟,不重训的“1比特量化”如何把千亿参数的硅基大脑塞进微型设备?
《读佳》获知,字节正在内测一款漫剧创作产品,名字就叫“漫剧创作工具”,Slogan“让创作更纯粹”,搭载豆包多个大模型。
在OpenAI一时半会没憋出来GPT 6的情况下,大模型排行榜被中国团队卷成麻花了。
过去几年,大模型的发展主线很清晰,比如更大的模型、更多的数据,以及更多的计算。但当模型从回答问题的Chatbot走向能够调用工具、执行任务的Agent,发展主线也开始发生变化。模型不仅要知道,还要在环境中行动,从反馈中判断结果,并在长时间运行中不断调整策略。
日产7.5万首,播放却不到3%。
过去几年,大模型推理系统优化的核心目标一直围绕一个问题展开:如何让 GPU 更高效地计算权重、激活、KV Cache 等高维张量?从并行策略、请求调度、显存管理到算子优化,学界业界大量优化技术不断提升模型推理效率。