全球AI安全竞技,中国开源模型通过率超90%,全球第三 开源第一

央视
08-06 09:59
摘要

8月5日,国际公认的AI安全基准CyberGym公布最新排名。

8月5日,国际公认的AI安全基准CyberGym公布最新排名。由国内顶尖人工智能研究机构与安全团队达酷诺威(DARKNAVY)联合研发的DoGNAVY,以90.8%的通过率位列全球第三、开源第一。

中国团队只用一款开源通用模型

CyberGym是当前规模最大的AI智能体网络安全测试,中国团队为何能跻身三甲?两条技术路线给出了答案。

排在前面的微软、谷歌,靠多个顶级闭源模型组合“作战”,每个环节路由给表现最好的模型——前提是同时买得到、用得起全世界最强的闭源模型。

DoGNAVY走的则是另一条路:只用一款开源通用模型(智谱6月开源的GLM-5.2),任何人都能下载、自由部署。

值得注意的是,中国方案DoGNAVY只用了一款开源通用模型,而排名靠前的对手依靠多个闭源模型组合使用。AI安全攻防正在进入实战化阶段,开源路线正在让顶尖安全能力被更多创新者掌握。

国产大模型百花齐放各展所长

调用量、下载量等指标持续走高的背后,是国产开源大模型创新生态的不断完善。从面向普惠的“经济适用”款,到深耕复杂推理的“大参数”款,国产大模型百花齐放、各展所长,丰富全球开发者选择。

7月27日晚,月之暗面正式将其自主研发的大模型Kimi K3的完整模型权重开源,并发布技术报告,以2.8万亿参数成为全球最大开源模型,补强复杂逻辑推理能力的短板。而在发布后一小时内,Kimi K3便登上了Hugging Face总趋势榜第一,受到全球开发者热捧。

中国电子信息产业发展研究院未来产业研究中心副研究员钟新龙认为,参数规模本身并不等同于模型能力,但如此大规模模型能够开放权重,说明我国企业已经具备超大模型训练、稀疏架构优化、低成本推理和全球化工程适配的综合能力。

而针对“投入巨额资源训练大模型,为何还要选择开源”的疑问,专家表示,我国企业持续开源,实质上是用模型投入换取长期的生态影响力。

钟新龙分析,开源不等于免费,更不意味着放弃商业回报。企业还可以通过云端推理、模型微调、智能体平台、行业解决方案和技术支持等多种方式获得收入。从商业逻辑看,训练成本正在转化为生态获客成本和产业基础设施投入,企业先通过开放扩大采用规模,再依靠服务能力实现变现,构建开源商业化高质量发展的新局面。

依托持续的技术迭代与开放生态建设,中国大模型正从单点技术突破,迈向技术、产业、生态协同发展的新阶段。

(央视)

相关链接

CyberGym是什么

CyberGym被业界视为AI安全能力的公开竞技场。它准备了1507项任务,全部来自188个真实开源项目中曾经存在、后来被修复的漏洞。该测试要求AI在只有代码和一段简短描述的条件下,自主理解问题、定位漏洞并完成验证,不能参考任何已知的修复方案。最终,DoGNAVY 通过其中1369项。

据悉,前两名均采用多款顶尖闭源模型协同作战的策略,DoGNAVY只使用了一款国产开源模型——GLM-5.2,可通过公开渠道下载并部署。从Agent基础设施到安全工作流,整套系统均为国内团队协作完成。这背后是一支将安全研究员经验系统化的AI团队。

编辑 白珊珊 审核 胡伟洪 李怡天

免责声明
未经许可或明确书面授权,任何人不得复制、转载、摘编、修改、链接读特客户端内容

读特热榜

IN视频

鹏友圈

首页