AI资讯新闻榜单内容搜索-训练

250行代码从头搭建Llama 3，GitHub一天4.6k星！Karpathy大赞

Llama 3发布一个月后，一位开发者在GitHub上创建了名为「从头开始实现Llama 3」的项目，引起了开源社区的广泛关注。代码非常详细地展现了Llama所使用的Transformer架构，甚至让Andrej Karpathy亲自下场「背书」。

来自主题: AI技术研报

11237 点击 2024-05-21 15:20

AI席卷音乐圈，索尼音乐率先“退出群聊”

5月16日，索尼音乐在官网上发布了一则声明，宣告索尼音乐将退出AI训练，禁止任何企业在尚未取得授权的状态下，以其内容训练AI模型，包括且不限于旋律、歌词、音频录音、视听录音、插图、肖像等。

来自主题: AI资讯

10639 点击 2024-05-21 09:57

LoRA数学编程任务不敌全量微调 | 哥大&Databricks新研究

大数据巨头Databricks与哥伦比亚大学最新研究发现，在数学和编程任务上，LoRA干不过全量微调。

来自主题: AI技术研报

4468 点击 2024-05-20 21:03

数据更多更好还是质量更高更好？这项研究能帮你做出选择

当计算预算低时，重复使用高质量数据更好；当不差钱时，使用大量数据更有利。

来自主题: AI技术研报

8038 点击 2024-05-20 18:52

150B token从头训练，普林斯顿Meta发布完全可微MoE架构Lory

前几天，普林斯顿大学联合Meta在arXiv上发表了他们最新的研究成果——Lory模型，论文提出构建完全可微的MoE模型，是一种预训练自回归语言模型的新方法。

来自主题: AI技术研报

11187 点击 2024-05-20 16:10

哈佛大学朱科航：自动化社会科学Agent与人类行为建模 | Agent Insights

大语言模型可谓是迄今为止对人类行为最大的建模，如何借助大语言模型工具，让科技发展更好地应用到真实人类社会中去？从哈佛物理系到大语言模型结合社会学和经济学的研究，朱科航的思考路径，聚焦在对人类行为的深度学习和理解。在开始今天阅读之前，大家不妨先猜一猜，大语言模型之前人类应用最广的 TOP2 机器学习是什么？Enjoy

来自主题: AI资讯

11092 点击 2024-05-20 15:43