AI资讯新闻榜单内容搜索-模型推理

PPIO派欧云发布全新算力云产品，助力大模型推理千倍降本

PPIO推出新AI产品，助力分布式云计算及AIGC应用。

来自主题: AI资讯

6560 点击 2024-09-05 15:13

KV Cache：图解大模型推理加速方法

KV Cache 是大模型推理性能优化的一个常用技术，该技术可以在不影响任何计算精度的前提下，通过空间换时间的思想，提高推理性能。

来自主题: AI资讯

7578 点击 2024-09-03 10:46

FuriosaAI推出高能效AI芯片：性能与英伟达L40S接近，功耗低40%！

8月27日消息，在近日召开的Hot Chips 2024大会上，韩国AI芯片初创公司FuriosaAI 推出了一款面向高性能大型语言模型和多模态模型推理的高能效数据中心AI加速器 RNGD。

来自主题: AI技术研报

7184 点击 2024-08-28 10:55

大模型推理成本降10倍、速度快20倍，AI Infra公司「趋境科技」在推理端开创模型落地新路径

2024年，落地，无疑是大模型最重要的主题。

来自主题: AI资讯

10528 点击 2024-08-20 16:31

想跑千亿大模型？算力厂商放大招！CPU通用服务器成为新选择

千亿参数规模的大模型推理，服务器仅用4颗CPU就能实现！

来自主题: AI资讯

6718 点击 2024-08-01 15:35

首个视频思维链推理框架Video-of-Thought来了：像人一样从感知到认知全面推理视频

最近，新加坡国立大学联合南洋理工大学和哈工深的研究人员共同提出了一个全新的视频推理框架，这也是首次大模型推理社区提出的面向视频的思维链框架（Video-of-Thought， VoT）。视频思维链VoT让视频多模态大语言模型在复杂视频的理解和推理性能上大幅提升。该工作已被ICML 2024录用为Oral paper。

来自主题: AI技术研报

10177 点击 2024-07-12 17:54

单卡A100实现百万token推理，速度快10倍，这是微软官方的大模型推理加速

微软的这项研究让开发者可以在单卡机器上以 10 倍的速度处理超过 1M 的输入文本。

来自主题: AI技术研报

6525 点击 2024-07-09 17:24

Apple的AI奠基性论文解读

如何在有限的内存下实现高效的大模型推理，是端侧AI发展的重要任务。

来自主题: AI技术研报

9732 点击 2024-06-27 10:40

百倍提升7B模型推理能力！颜水成团队携手新加坡南洋理工大学发布Q*算法

近日，一篇出自中国团队之手的AI论文在外网引发热议。论文中，研究团队提出了Q*模型算法，帮助Llama-2-7b等小模型达到参数量比其大数十倍、甚至上百倍模型的推理能力，使模型性能迎来惊人提升。

来自主题: AI资讯

9994 点击 2024-06-26 10:57

昆仑万维携手南洋理工大学抢发Q*算法：百倍提升7B模型推理能力

自 OpenAI 的 Q* 项目曝光后，引发业内众多讨论。据现有信息汇总，Q* 项目被视作 OpenAI 在探索人工通用智能（Artificial General Intelligence, AGI）道路上的一次重大尝试，有望在包括数学问题解决能力、自主学习和自我改进等多个层面对人工智能技术带来革新性突破。

来自主题: AI技术研报

9997 点击 2024-06-25 18:20