一份CUDA源码,跑上了苹果GPU
一份CUDA源码,跑上了苹果GPU一段原本为英伟达 CUDA 设计的计算程序,几乎无需修改内核代码,就直接跑在了一台搭载 M3 Pro 的苹果设备上。
搜索
一段原本为英伟达 CUDA 设计的计算程序,几乎无需修改内核代码,就直接跑在了一台搭载 M3 Pro 的苹果设备上。
AI竟写出了,史上最快内核!在全新一轮GPU算子基准测试KernelBench-Mega中,Fable 5表现一骑绝尘。它在RTX PRO 6000,全程「纯手搓」CUDA,速度狂飙18.7倍。相比之下,强如Claude Opus 4.8也只跑出14.4倍,而GPT-5.5只有4.34倍。
GPT-5.6 Sol预览版发布小半个月了,首批用户内测报告终于新鲜出炉!英伟达首席工程师用最直白最不绕弯子的话告诉你:Sol很猛!30小时,就跑赢了Opus 64小时才达到的CUDA加速效果。后续版本优化后,或将彻底碾压Opus……
5 月 22 日,Tri Dao 在社交媒体上转发了 Han Guo 的一条推文。他还写道:「经过一些数学重写,结果发现 Transformer 的所有内容都是一系列 GEMM + epilogue(矩阵乘法加尾声)。给定一些优化的原语,LLM(以及新手)就可以为所有 Transformer 操作编写光速内核!」
老黄在北京喝豆汁「翻车」,全网笑疯了。但真正值得警惕的,是他背后那个正在长出来的「中国版CUDA生态」。从万卡集群到机器狗,从SGLang主线到AI Agent自动迁移,这家公司这次不只是秀芯片,而是在重写国产GPU的游戏规则!
很少看到黄仁勋这么激动。接近两个小时,正面回答关于英伟达一路在大模型时代涨到4万亿美元市值的种种问题。黄仁勋在“硅谷最受欢迎播客”的全新访谈,信息量有点高。视频发布半天,单在油管上的观看量已经超过10万+。
代码大模型会写代码,这件事已经不新鲜了。
现有的 LLM 自动化 CUDA 方法大多只能优化单个 Kernel,面对完整的端到端 GPU 程序(如整个 VisionTransformer 推理)往往束手无策。
让AI自己写高性能GPU代码,字节Seed与清华AIR团队做到了。
Clawdbot火爆全球,国产算力却不能用?AI Agent迎来高光时刻:Ollama只支持CUDA,中国团队直接把国产版开源了!正面硬刚Ollama,5分钟让国产芯片跑通OpenClaw!