您正在使用IE低版浏览器,为了您的雷峰网账号安全和更好的产品体验,强烈建议使用更快更安全的浏览器
雷峰网公开课
活动中心
GAIR
专题
爱搞机
业界
人工智能
学术
开发者
智能驾驶
数智化
零售数智化
金融数智化
工业数智化
医疗数智化
城市数智化
金融科技
科技巨头
银行AI
金融云
风控与安全
//= baseUrl()?>
医疗科技
医疗AI
投融资
医疗器械
互联网医疗
生物医药
健康险
芯片
政企安全
智慧城市
智慧安防
智慧教育
智慧交通
智慧社区
智慧零售
智慧政务
智慧地产
行业云
工业互联网
工业软件
工业安全
5G工业互联网
工业转型实践
AIoT
物联网
智能硬件
机器人
智能家居
此为临时链接,仅用于文章预览,将在
时失效
业界
正文
发私信给
陆毅
发送
0
对比 Codex,免费的 AgnesCode 也能在底层算子优化任务中打得有来有回
本文作者:
陆毅
2026-09-14 16:39
导语: AgnesCode在部分芯片上跑出更高性能,免费模型完成专业级交付。
AgnesCode在部分芯片上跑出更高性能,免费模型完成专业级交付。
作者丨
吴海明 曹PP
编辑丨李 娜
免费的 AI Coding Agent,能不能和付费 Codex 在真实工程任务里打得有来有回?
过去一年,我们已经习惯了让 Coding Agent 写网页、做应用、修 Bug。但这一次,我们想把它往更底层推一步:
让 AI 去优化大模型自己运行时使用的算子
。
所谓“算子”,可以简单理解为
大模型运行时
反复执行的
一小段底层计算程序
。
模型每生成一个 Token,都要在 GPU 或其他 AI 芯片上执行大量矩阵计算、注意力计算和数据变换。单个算子看起来很小,但会被模型反复调用。因此,一段高频算子如果能快 10%、20%,最终就可能转化为推理速度、硬件利用率和服务成本上的实际差异。
这恰好提供了一种不同于常规 Coding Benchmark 的测试方式:如果 Agent 能够读懂任务、修改算子、适配不同芯片,并最终跑出真实的性能提升,那么它触及的已经不只是应用开发,而是 AI Infra 中一部分真正的工程工作。
为了回答这个问题,我们把 AgnesCode + Agnes 3.0 Flash 放进众智 FlagOS 开放计算全球大赛的一道算子优化题:为 DeepSeek-V3 解码阶段使用的底层算子写优化代码,并在 8 款芯片上接受赛事官方自动化评测,同时,选择 Codex + GPT-5.6 Sol 组合作为对照。两组候选者使用完全相同的环境为算子撰写优化代码,最终都提交到赛事官方的自动化评测系统进行评测。
结果很有趣:
两组选手都顺利完成了任务,Codex + GPT-5.6 Sol 用 8 分 57 秒给出结果,AgnesCode + Agnes 3.0 Flash 在中途被测试人员催促了一次后,耗时 20 分 36 秒完成任务。经过官方自动化评测后,对比 Codex 通过7款芯片的战绩,AgnesCode 略逊一筹,通过了 6 款芯片;但在双方共同通过的 5 款芯片上,AgnesCode 有 4 项加速比更高,其中在国际通用芯片 B 上达到 4.81×,高于 Codex 的 3.71×,加速比分数高出约 29.6%;昆仑芯上也只有 AgnesCode 通过测试。
这不只是一个“免费模型全面替代付费模型”的故事,还说明了另一件事:当任务边界、工具链和评测闭环足够清晰时,免费 Agent 已经可以进入底层工程任务,并交出可验收、有性能收益的产物。
Agent 时代,模型便宜只是入场券,能把任务交到终点才是分水岭。
本文真正想回答的,是当 AI 开始拧紧自己的底层螺丝,免费的 AgnesCode 距离一个可用的工程助手还有多远。
01
一道题:
优化 DeepSeek-V3 底层算子
考虑到常见测试任务的数据很可能已经用于模型训练,导致模型本身已经很擅长,因此,在这次测试中,我们直接跳过常见的网页生成、数据看板、文案撰写等常见测试场景,选择让 AgnesCode 直接挑战更接近基础工程的题目:大模型推理算子优化。
具体来说,算子是模型算法
能运行
的基础环节,模型每生成一个 Token,背后都要反复调用矩阵乘法、注意力、归一化、激活函数等底层算子。在单个算子上几个百分点的加速比,往往直接变成推理延迟、显存占用和服务成本的差异。
更重要的是,算子优化正在成为 AI 自进化的一部分
,过去,优化这类底层代码高度依赖系统工程师手写经验;现在,Coding Agent 开始尝试读任务、写算子代码、跑测试、看报错、再改代码,
这是 AI 开始反过来优化自身运行底座的一种工程样本
。
所选测试题来源截图1: 众
智 Fl
agOS 开放计算全球大赛赛季二的赛道一
需要说明的是,这次的测试题目来自众智 FlagOS 开放计算全球大赛赛季二的赛道一:SGLang框架算子在多款芯片的性能优化。该比赛围绕 SGLang 推理框架开放了 200 余道算子任务,每周发布一批算子题目,参赛者只能在本周内看到赛题内容。因此,这可以极大保证测试任务的数据没有被测试模型提前学习,对评测对象来说,这完全是一次
“
摸底考试
”。
所选测试题来源截图2: 200+算子的多芯片优化任务
具体来说,我们选择了一道
DeepSeek-V3 在解码阶段使用的融合 QKV-A 下投影算子
题目(Task66: dsv3_fused_a_gemm)作为测试任务,该算子是将输入特征与合并后的投影权重相乘,一次完成 Q 分支和 KV 分支的前置投影,为后续注意力计算准备数据。题目本身的计算并不难,真正的挑战在于考察 AgnesCode 能否生成一套优化算子代码能快速通过 8 款芯片(2款国际芯片、天数智芯、沐曦、燧原、海光信息、昆仑芯和华为)。
所选测试题来源截图3: Task66-dsv3_fused_a_gemm 赛题
02
对打 Codex:
入口名翻车,但性能结果并不弱
为了更好知道 AgnesCode 的行业水平,我们选择 Codex+GPT-5.6 Sol 组合作为对照组,AgnesCode 则用官方提供的免费模型 Agnes 3.0 Flash 作为后台。我们为两个组合同时提供一个标准化的 Skill,该 skill 提供了赛制的全部信息,例如如何命名每个代码文件、如何在代码文件中命名函数名、写完代码以后要打包等。之后,我们在相同的环境下让两个组合为测试题撰写代码。
具体地,我们首先让两个组合在一台含有 NVIDIA 芯片的机器上撰写第一个版本代码,然后再基于这个版本代码撰写适配其他所有芯片的代码。
从运行过程来看,AgnesCode + Agnes 3.0 Flash 组合在第二阶段生成代码的时候,首先花费了7分10秒没有给出答案,经过测试人员催促以后,再次经过13分26秒后给出了 针对不同后端调整优化的代码。包括语法、禁用项和文件依赖检查,最终整理提交包,并更新开发记录。整体来看,从编写实现、跨芯片适配,到代码自检、打包和交付,这个组合已经能够围绕一个专业任务推进完整的工作流程。
AgnesCode + Agnes 3.0 Flash 组合运行截图
再来看看 Codex+GPT-5.6 Sol 组合的表现,相对AgnesCode + Agnes 3.0 Flash 组合 整体使用 20 分 36 秒的时间开销,Codex+GPT-5.6 Sol 组合仅用8分57秒就给出了结果。对比来看,Codex+GPT-5.6 Sol 组合的整体工作推进更快,也更加流畅。
Codex+GPT-5.6 Sol 组合运行截图
任务推进过程是一方面,两个模型经过系统评测的效果如何呢?
众智 FlagOS 开放计算全球大赛赛事官方自动化评测结果截图,第一行为 AgnesCode + Agnes 3.0 Flash 测评结果,第二行为 Codex+ GPT-5.6 Sol 测评结果。
整体来看,虽然在芯片的适配数量上,AgnesCode 落后Codex 一个,仅有六个芯片通过了测试。但在双方共同通过的五个芯片上,AgnesCode 有四项加速比更高,在天数智芯上,AgnesCode 为 2.16×,Codex为 1.72×;在国际通用芯片 B 上,AgnesCode 达到 4.81×,高于对照组的 3.71×,加速比分数高出约 29.6%;在昆仑芯上仅有 AgnesCode 通过了测试,并取得来2.56X的加速比。
该结果表明,AgnesCode + Agnes 3.0 Flash 交付了能够在多个平台获得实际加速的算子成果,体现了一定的竞争力,但在跨平台覆盖和最终验收,仍有继续改进的空间。
最后,对于一个绕不开的话题——成本,AgnesCode + Agnes 3.0 Flash 完全免费,这让它在真实的业务场景里更具吸引力。很多任务往往需要多轮问答才能获得较为不错的效果,而且模型还需要反复读取文件、根据用户反馈进行调整。若按闭源模型计费,账单很可能快速爆炸,而免费模型至少把“敢不敢让多试几轮”的门槛降了下来。
03
AA榜单揭示
Agnes 3.0 Flash 的能力边界
上述测试可以发现,免费的 AgnesCode+Agnes 3.0 Flash 完全可以和付费订阅的 Codex+ GPT-5.6 Sol 打的有来有回,这是个例还是普遍存在呢?
对此,我们调取了 Artificial Analysis (AA榜单)公布数据,其中的 Intelligence Index 指标综合考察模型在工作任务、工具执行、编程、复杂推理、知识可靠性与长上下文等方面的表现,为模型的整体水平提供参照,Agnes 3.0 Flash 的得分为 36 分,即为接近 GPT-5.6 Luna(max)的 38 分。这说明 Agnes 3.0 Flash 本身能力已经和主流模型能力不相上下了。
Artificial Analysis (AA榜单)公布数据截图
在 Artificial Analysis 的智能表现 × Token价格对比中,Agnes 3.0 Flash以约 0.03 美元/百万 Token 的价格进入最具吸引力区间,并位于帕累托前沿。
另外,把能力和价格放到同一张图里看,Agnes 3.0 Flash 的位置会更直观。AA 榜单的智能表现 × Token 价格对比显示,它以约 0.03 美元/百万 Token 的价格,进入了图中最具吸引力的低价高能区间:横向看,它的价格显著低于多数同等智能表现的模型;纵向看,在相近价格带里,拿到了更靠前的智能表现,这直接让模型坐稳帕累托前沿的位置。
从实际的 Agent 工作流来说,这个位置尤其重要,因为长任务会不断放大 Token 消耗,模型每便宜一点,都会直接影响用户是否愿意让它持续读文件、改代码、跑测试和反复迭代。
Artificial Analysis (AA 榜单)的智能表现 × Token 价格对比数据截图
04
免费又不失性能,
为 AI 进化带来更多探索空间
通过代码优化测试可以发现,AgnesCode + Agnes 3.0 Flash 已经能自动化生成能被系统验收、能被继续迭代、能在成本上算得过账的交付物。
Agent 时代,模型便宜只是入场券,能把任务交到终点才是护城河。
换句话说,
随着 AI 的发展,用户需要的不再只是生成应用,而是 AI 开始拧紧自己的底层螺丝。
从结果看,AgnesCode + Agnes 3.0 Flash 展示了两个信号:
1.在有明确工作流、任务文件和评测反馈的情况下,它已经能推进跨芯片算子适配,并在部分芯片上跑出更高加速比。
2.Agent 可能会在“最后一公里”犯错,例如入口命名、提交规范、覆盖范围等细节,这些问题不一定抹掉性能亮点,但会直接决定结果能不能被真实系统接收。
模型能力决定上限,工作台能力决定它能不能稳定抵达上限
。
对开发者和企业用户而言,AgnesCode 的优势不只在模型本身,也在它把模型、项目文件、Skill、命令执行和评测反馈组织到同一个工作流里,帮助用户少打扰、少返工、少花钱地把事做完。
从算子优化来说,这也是国产 AI 芯片生态正在面对的现实问题,不同芯片之间的差异,不会因为上层框架统一就自动消失;推理框架、算子库、编译工具链和真实业务负载之间,仍然需要大量适配工作。如果 Agent 能进入这条链路,它就有机会把过去依赖少数系统工程师经验的优化工作,变成可以持续生成、持续验证、持续迭代的工程流程。
对比,Codex + GPT-5.6 Sol 在任务推进速度和整体流畅度上依然更占优,AgnesCode + Agnes 3.0 Flash 也暴露出交付细节上的不稳定。但同时证明了一件事:免费模型并非只能停留在简单任务层面,只要工具链、上下文和评测闭环足够明确,它同样可以进入专业工作流,并交出有竞争力的结果。
免费模型的真正价值,正在从让 AI 变得更便宜转向让更多真实任务有机会被 AI 反复尝试。
当试错成本下降,Agent 才可能从“偶尔帮忙”变成“持续干活”;当持续干活成为可能,谁能把专业要求稳定写进执行过程,谁就更接近下一代 AI 工作台的入口。
0
人收藏
分享:
相关文章
AgnesCode
Agnes 3.0 Flash
模型
具脑磐石发布业界首个类脑认知世界模型 Cog-WM 1.0
斜跃智能完成数亿元天使+轮融资,加速推进Duplex Re ...
大模型牌桌上,蚂蚁如何出牌?
从完成任务到自主发现,Agent后训练寻找下一个Scali ...
陆毅
编辑
发私信
当月热门文章
RoboScience 机器科学发布轮式仿人形通用机器人 REX G1,让机器人真正成为新一代具身生产力伙伴
Current Robotics完成数亿元融资,布局人形智能
机器人从炫技 Demo 走向上岗,两篇 ICML 顶会论文拆解背后的智能底座
缩小物理智能鸿沟:深度机智 PhysBrain 1.5 登顶开源,逼近 GPT‑6 Astra
所有人看见了「大晓速度」,但真正值钱的是它背后的这套系统
最新文章
全球AI大厂集体呼吁“限速” 360:AI安全不能靠企业自审,需第三方攻防把关
蚂蚁百宝箱推出全新商圈智能体模版,万达率先发布逛街Agent
豆包手机助手发布消费者版本 首款新机将于9月16日正式开售
斜跃智能完成数亿元天使+轮融资,加速推进Duplex Reasoning全新范式具身基础模型
蚂蚁数科在外滩大会达成31项AI合作,推动智能体走进千行百业
2026服贸会期间 七国政要议员体验萝卜快跑 “取经”中国绿色出行新质生产力
热门搜索
大模型
数字化
印度
裁员
搜狗
用户体验
LBS
AI芯片
宅客
iPhone 4S
地图
请填写申请人资料
姓名
电话
邮箱
微信号
作品链接
个人简介
为了您的账户安全,请
验证邮箱
您的邮箱还未验证,完成可获20积分哟!
重发邮箱
修改邮箱
请验证您的邮箱
立即验证
完善账号信息
您的账号已经绑定,现在您可以
设置密码
以方便用邮箱登录
立即设置
以后再说