AI资讯新闻榜单内容搜索-ageval

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
搜索: ageval
配套CLI与Skills,浙大开源可插拔Agent评测底座

配套CLI与Skills,浙大开源可插拔Agent评测底座

配套CLI与Skills,浙大开源可插拔Agent评测底座

同一套模型,换一个coding agent运行时,测试得分和实际消耗往往大相径庭。

来自主题: AI技术研报
8835 点击    2026-09-14 09:49
全球百模争霸,国产大模型拿下多个冠军!智源FlagEval全球评测榜单出炉

全球百模争霸,国产大模型拿下多个冠军!智源FlagEval全球评测榜单出炉

全球百模争霸,国产大模型拿下多个冠军!智源FlagEval全球评测榜单出炉

2024年快要结束了,世界大模型究竟孰强孰弱?刚刚,智源研究院发布了下半年大模型综合评测结果,涵盖了开源闭源100+模型,横跨文本、语音、图像和视频等多个领域。

来自主题: AI资讯
9392 点击    2024-12-20 15:12
100+大模型综测结果出炉!智源发布FlagEval“百模”评测结果,覆盖文本语音图片视频多种模态

100+大模型综测结果出炉!智源发布FlagEval“百模”评测结果,覆盖文本语音图片视频多种模态

100+大模型综测结果出炉!智源发布FlagEval“百模”评测结果,覆盖文本语音图片视频多种模态

2024年12月19日,智源研究院发布并解读国内外100余个开源和商业闭源的语言、视觉语言、文生图、文生视频、语音语言大模型综合及专项评测结果。

来自主题: AI资讯
10172 点击    2024-12-20 09:43
RAGEval:实现实际场景检索增强生成系统(RAG)的“精准诊断”

RAGEval:实现实际场景检索增强生成系统(RAG)的“精准诊断”

RAGEval:实现实际场景检索增强生成系统(RAG)的“精准诊断”

清华大学NLP实验室联合北京师范大学、中国科学院大学、东北大学等机构的研究人员推出了全新的评测方法 RAGEval,通过快速构建场景化评估数据实现对检索增强生成(RAG)系统的“精准诊断”。

来自主题: AI技术研报
6381 点击    2024-11-08 19:31