技术Blog | 超强端侧多模态大模型MiniCPM-V 2.0: 具备领先OCR和理解能力
技术Blog | 超强端侧多模态大模型MiniCPM-V 2.0: 具备领先OCR和理解能力MiniCPM 系列的最新多模态版本 MiniCPM-V 2.0。该模型基于 MiniCPM 2.4B 和 SigLip-400M 构建,共拥有 2.8B 参数。MiniCPM-V 2.0 具有领先的光学字符识别(OCR)和多模态理解能力
搜索
MiniCPM 系列的最新多模态版本 MiniCPM-V 2.0。该模型基于 MiniCPM 2.4B 和 SigLip-400M 构建,共拥有 2.8B 参数。MiniCPM-V 2.0 具有领先的光学字符识别(OCR)和多模态理解能力
如何复盘大模型技术爆发的这一年?除了直观的感受,你还需要一份系统的总结
现今,机器学习(ML),更具体地说,深度学习已经改变了从金融到医疗等广泛的行业。在当前的 ML 范式中,训练数据首先被收集和策划,然后通过最小化训练数据上的某些损失标准来优化 ML 模型
Adobe 全家桶马上就要拥有最先进的生成式 AI 视频创作能力了
Transformer 的重要性无需多言,目前也有很多研究团队致力于改进这种变革性技术,其中一个重要的改进方向是提升 Transformer 的效率,比如让其具备自适应计算能力,从而可以节省下不必要的计算。
Sora要被集成在Adobe视频剪辑软件里了。 在最新发布的Premier Pro概念演示里,Adobe展示了与OpenAI合作的探索成果: 在主镜头之外,完全由Sora生成一段B-roll辅助镜头。
北京大学再次卫冕! 第十一届ASC世界大学生超算竞赛总决赛,在上海大学落下帷幕。 北京大学再次斩获决赛冠军,亚军则被中山大学拿下。
生成式AI人脸造假套路多,怎么办? 现在,专门用于DeepFake的综合性产品上新了—— ZOLOZ Deeper,蚂蚁数科ZOLOZ出品。我们日常的支付宝刷脸支付,正是依托于他们技术支撑。
大模型颠覆一切,终于还是颠到了本小编头上。 还是一个一句话就被打造出来的Agent。 像这样,抛给Ta一篇文章,不到1秒,标题建议就新鲜出炉了。
从国际顶流 GPT-4 128K、Claude 200K 到国内「当红炸子鸡」支持 200 万字上下文的 Kimi Chat,大语言模型(LLM)在长上下文技术上不约而同地卷起来了