竞赛编程Agent进入全球前十!南大、清华新模型CF rating超3500
竞赛编程Agent进入全球前十!南大、清华新模型CF rating超3500大语言模型在代码生成上的能力不断增强,但在复杂算法题,尤其是竞赛编程场景中,仍然容易因为算法选择错误、边界条件遗漏、复杂度判断失误或隐藏测试覆盖不足而失败。Solvita是一款面向竞赛编程的智能体框架,通过四个角色(Planner、Solver、Oracle、Hacker)形成闭环系统,并利用可训练的图结构知识网络积累经验。
搜索
大语言模型在代码生成上的能力不断增强,但在复杂算法题,尤其是竞赛编程场景中,仍然容易因为算法选择错误、边界条件遗漏、复杂度判断失误或隐藏测试覆盖不足而失败。Solvita是一款面向竞赛编程的智能体框架,通过四个角色(Planner、Solver、Oracle、Hacker)形成闭环系统,并利用可训练的图结构知识网络积累经验。
如果你的日常任务里包含编程,今天给大家介绍一个特别适合团队用的AI开发平台「MonkeyCode」,目前在GitHub已狂揽3.4k Star,开源免费。开源地址:github.com/chaitin/MonkeyCode
据DeepSeek官方API文档及GitHub仓库信息,一款名为Deep Code的第三方开源AI编程助手近日被收录进DeepSeek Agent工具。该工具面向DeepSeek-V4系列模型做了适配,支持深度思考、推理强度控制、Agent Skills以及MCP集成。截至发稿,Deep Code GitHub仓库显示,该工具收获超1500星、127 fork。
在近日豆包宣布全面下线“智能体”功能之前,其“应用生成”功能已于5月31日率先停止服务。目前,用户此前通过该功能创建的历史应用,仍可在豆包会话中进行查看、复制、下载及分享,但无法再新建或更新。不过,其编程功能依然保留。
上个月 GLM 5.2 发布的时候,我写过一篇文章,说智谱家出了个叫 ZCode 的编程工具,专门给 GLM 5.2 做开发环境。当时就是简单上手体验了一下,觉得还行,是个正经的 AI 编程产品。
设想这样一幕:你让一个编码智能体修复某个 bug,并用一组单元测试作为「做对了没有」的判据。
Base44 是一家 vibe-coding 平台,一年前被 Wix 以 8000 万美元收购。当时,这家公司成立还不到六个月,团队只有 8 个人。如今,Base44 开始推出自己的 AI 模型,帮助用户通过自然语言创建应用。
上个月也就是昨天,我写了一篇LongCat 2.0的实测,用四个任务测了一下它的编程能力,当时我的评价是「有些地方惊艳,有些地方还差点意思」。
6月30日晚,AI龙头Anthropic推出了专为科学研究打造的新产品Claude Science,这是一款类似于编程工具Claude Code的AI工作台。简单来说,Claude Science是一套专门为科研需求打造的多智能体架构,能自动生成多个子代理并分配他们进行科研任务。
就在刚刚,Claude Sonnet 5来了!代号Fennec,耳廓狐,撒哈拉沙漠里体型最小的狐狸。相较于上一代Sonnet 4.6,Sonnet 5在推理、工具使用、编程和知识工作任务中,性能显著提升。