方升-Code 2.0发布,大模型基准测试体系迎来新标准

2026-09-11 21:42:02
来源:北京商报
分享
AIME

问财摘要

1、中国信通院在2026年服贸会上发布了“方升-Code2.0”大模型基准测试体系,回应了当前AI代码评测体系的局限性。该测试选取代码生成、问题解决、单元测试、研发问答四类典型任务,动态选取不同难度等级测试数据287条。 2、评测指标体系包括代码能力表现、工程质量与实际价值、效率成本分析、过程表现衡量、能力稳定性等。 3、中国信通院将携手产业各界,继续构建能够科学反映人工智能在软件行业应用真实情况的评测体系。
免责声明 内容由AI生成
文章提及标的

2026年,AI大模型正从通用对话走向代码生成、智能体协作等产业落地场景,模型代码能力的标准化评估需求也日益凸显。

9月11日下午,中国信息通信研究院(以下简称“中国信通院”)在2026年中国国际服务贸易交易会(以下简称“服贸会”)智能原生软件变革与创新交流活动上,升级发布“方升-Code2.0”大模型基准测试体系。

“方升-Code”是中国信通院在工信部指导下研发的代码大模型基准测试体系。本次发布的2.0版,回应了当前AI代码评测体系在工程实践中暴露出的局限性。复旦大学计算与智能创新学院副院长、教授彭鑫指出,当前行业榜单繁荣,但很多评测集的初衷“是AI能力的练兵场,而非软件工程的试金石”,且存在评测任务偏简单、数据质量不高、验证标准单一、缺少科学难度分级等问题。

针对上述问题,中国信通院人工智能(885728)所平台与工程化部主任曹峰介绍了方升-Code的建设思路。他表示,方升-Code面向能力发现与生产部署需求,核心要求是构念清晰、任务真实、测量稳定和有效性验证,旨在刻画模型能力边界,支撑模型研发与应用部署选型。目前,方升-Code基准测试已构建5000余条高质量、多任务的评测数据,所有数据均来自真实的软件研发项目。本次测试选取代码生成、代码问题解决、单元测试、研发问答四类典型任务,动态选取高、中、低不同难度等级测试数据287条。

彭鑫进一步介绍,方升-Code2.0从单一正确率转向多维综合测量,评测指标体系包括代码能力表现、工程质量与实际价值、效率成本分析、过程表现衡量、能力稳定性等。未来评测数据集将持续更新,并针对重点测评任务种类的高难度任务进一步开展精细化难度分级,加强被测模型和Agent(智能体)的能力识别区分度。

曹峰指出,评测范式正由“代码能否生成”走向“复杂工程任务能否持续、稳定完成”。大模型能力竞争焦点不是“一套题得分更高”,而是能否稳定完成更长、更复杂的真实研发任务。

工信部数据显示,2026年1-5月,我国软件业务收入约6.25万亿元,同比增长10.3%;截至6月,日均Token调用量已突破500万亿。

这一趋势也得到了政策层面的呼应。工业和信息化部近日印发的《“人工智能(885728)+软件”专项行动实施方案》提出,到2028年,累计组织实施100项软件企业智能化技改项目,在重点行业打造100个智能体软件标杆应用;到2030年,关键软件全面实现智能化升级,智能编程、智能体软件及智能服务等新业态成为产业新增长极。

中国信通院人工智能(885728)研究所平台与工程化部高级业务主管秦思思在分享中指出,智能原生软件正推动软件从“提供功能”向“理解目标、规划任务并自主执行”演进,软件产品的测试也将更加关注智能任务执行与结果质量。

“下一步,中国信通院将携手产业各界,继续构建能够科学反映人工智能(885728)在软件行业应用真实情况的评测体系,为我国政策制定和产业落地提供准确参考。”中国信通院人工智能(885728)研究所所长魏凯说道。

免责声明:风险提示:本文内容仅供参考,不代表同花顺观点。同花顺各类信息服务基于人工智能算法,如有出入请以证监会指定上市公司信息披露平台为准。如有投资者据此操作,风险自担,同花顺对此不承担任何责任。
homeBack返回首页
不良信息举报与个人信息保护咨询专线:10100571违法和不良信息涉企侵权举报涉算法推荐举报专区涉青少年不良信息举报专区

浙江同花顺互联信息技术有限公司版权所有

网站备案号:浙ICP备18032105号
证券投资咨询服务提供:浙江同花顺云软件有限公司 (中国证监会核发证书编号:ZX0050)
AIME