已获5项发明专利!深圳研究团队开源代码模型获多项评测第一
创始人
2026-08-17 23:22:34
0

写代码的AI不少,但能像科学家一样“先假设、再验证、错了就改、改完再验”的AI,还真不多见。近日,清华大学深圳国际研究生院刘厚德教授、王立博博士后团队正式开源了一款代码大模型——VeriLoop Coder-E1(中文名:循证),这款模型专门解决真实软件工程中的代码修复问题。

该大模型的特别之处在于:不是让AI闷头写代码、写错了再重来,而是给它装了一套“循证闭环”,每一轮生成的代码都必须经过测试验证,通不过就分析原因、修正错误,然后再验证,直到产出可靠代码。

传统反复修改与 VeriLoop递归式自我改进路径对比。

该模型将代码生成、工具调用、测试反馈、错误修正和回归控制组织为可持续迭代的闭环,为代码智能体由程序文本生成向仓库状态理解、修改执行与结果验证演进提供新方案。

该系统基于循证原理:循证不是用信息为既有结论提供装饰或支持,而是让证据能够挑战并改变系统当前的认识、行动或未来探究方式。

团队据此改良了递归式自我改进机制:系统不是反复修改自身,而是经证据纠正的方法,改变未来如何发现、判断和纠正错误,并且这一方法仍然允许被新的证据再次推翻。

这意味着系统不会仅因“能改变自身”而实现改进,只有当证据开始改变它“未来如何改变自身”时,递归式自我改进才真正发生。

在公开软件工程基准评测中,VeriLoop Coder-E1在验证软件工程基准(SWE-bench Verified)得分85.20、专业版软件工程基准(SWE-bench Pro)得分62.38、终端任务基准(Terminal-Bench 2.0)得分76.40、软件工程智能体基准(Deep SWE)得分33.63。

截至2026年7月27日,根据Hugging Face平台公开社区榜单收录的团队发布(self-published)评测结果,VeriLoop Coder-E1在32B及以下开源模型中,前三项位列第一,软件工程智能体基准位列第二;在全部开源模型中,四项分别位列第二、第一、第一和第五。比测对象中包括DeepSeek-V4-Pro、MiniMax-M3、GLM-5.2、Kimi-K3、Qwen3.6-27B等知名大模型版本。

成果发布后,第三方社区基于公开权重制作了适用于个人电脑、苹果芯片设备及本地大模型推理工具的量化版本。截至2026年8月6日,两项主要社区量化版本下载量分别为16120次和8541次,同期官方模型仓库下载量为763次。

除代码智能系统外,团队还自主研发了面向智能硬件的多模态交互智能体“丸子”,实现将语音、视觉、记忆和性格设计为按需启动的能力。用户说话时调用语音交互,需要理解周围环境时开启视觉,涉及过去信息时检索或写入记忆,并根据不同对象和场景加载相应的性格与表达方式。

在该技术方向,实验室已获得5项发明专利授权,相关专利形成了从模型底层稳定性、循证闭环推理到通用编程智能体执行控制与多模态交互的完整技术链条。

采写:南都N视频记者 伍曼娜 通讯员王立博 吴鸿瑶

相关内容

最新资讯

家门口的普法课,十年不缺席 (来源:邯郸晚报) 夏日炎炎,暑期时光悠长,孩子的假期安全与充实成长是千家万户的牵挂。漫长假期里,...
别人暑假奔赴山海,我养出预制小... 文/许MM 这个夏天,朋友圈的画风太割裂了。 别人家七岁娃:海边踏浪、山野露营、乐园疯玩、追晚霞、...
为何人们不买账扎克伯格描绘的A... Meta CEO 马克·扎克伯格本周发表了一篇长达6500字的文章,宣称"未来属于每一个人",并描绘...
已获5项发明专利!深圳研究团队... 写代码的AI不少,但能像科学家一样“先假设、再验证、错了就改、改完再验”的AI,还真不多见。近日,清...
周一科普故事 | 白天看不到星... ? 点击下方卡片听易读猫姐姐讲故事」 1、学习天文知识:光强遮星光、恒星与太阳 2、培养观察力:白天...
美伊“不战不和”僵局还要持续多... 美伊停火谅解备忘录时限届满,伊朗社会各界对局势有哪些担忧?凤凰卫视驻伊朗记者李睿从德黑兰发回最新报道...
大冷门!羽毛球世锦赛-卫冕冠军... 北京时间8月17日消息,2026年世界羽毛球锦标赛今天在印度新德里揭开战幕,男单首轮便爆出开赛最大冷...
被读者当面“拷问”高考阅读题,... 8月16日上午,茅奖作家徐则臣在江北图书馆做新书分享活动过程中,被读者当面“拷问”,对自己进入高考试...
守护假期情绪健康,这份心理调适... 快乐暑假 从“心”出发 脱离了上学时的紧凑作息 享受轻松假日的同时 一些孩子可能 会感到无聊、焦虑 ...
四川巴中警方发布认领公告:谁的... 8月17日,网传巴中警方发布一则《认领公告》,为3999.577万元资金找主人。 ▲认领公告截图 ...