“社区里每天都有上万条鹈鹕骑单车的视频被发到群里,大家问我这只鹈鹕是不是变笨了?”开源项目CodexRadar的发起人Lambda,在GPT-6 Astra发布后,每天收到海量的鹈鹕视频,于是他索性在社区里组织了一场“鹈鹕杯”比赛。
参赛者围绕“画一只骑自行车的鹈鹕”这个目标,用模型生成作品,然后将结果分享到社区。
“深夜上线,没做任何推广,就收到了将近一百份投稿。”Lambda也没料到,大家对“鹈鹕测试”的热情会这么高涨。
每当有新模型上线,总会有人用鹈鹕骑自行车来检验模型的能力。
一方面,这个任务足够简单且直观。模型的许多复杂能力很难通过一句话快速判断,但鹈鹕骑自行车却容易让人一眼看出稳定性,比如腿和踏板是否对齐、车轮是否同步转动、动作有没有破绽、前后生成是否连贯。
另一方面,这个任务又足够复杂。它看起来只是一小段提示词,但背后涉及动作理解、时序一致性、空间关系、代码组织和连续执行能力。对于一个已进入Agent阶段的模型来说,这类任务非常适合作为“体感温度计”。
GPT-6 Astra上线后,这只鹈鹕“更火了”,原因在于这个最先进的模型“智商”很不稳定,而智商直接影响工作成果。
鹈鹕恰好能把这种难以量化的体感变得非常直观。
01 一只鹈鹕,如何测试模型“变笨”
鹈鹕杯比赛分为两个赛道。Classic赛道使用统一的提示词“创建一个HTML,内容是SVG绘制一个鹈鹕骑自行车的2D动画”。只要模型状态正常,GPT-6 Astra生成的鹈鹕通常会保持相对一致的质量和画面结构。
图:用户上传到社交网络的鹈鹕图,可以看出,GPT-6 Astra在各种推理强度下,如果智商保持稳定,鹈鹕的出图基本保持一致。
如果某天大量用户突然发现,在同一个提示词下,鹈鹕开始频繁踩空、车轮关系混乱、结构明显偏离,“变笨”的讨论就会迅速出现。
这种方法当然算不上严格的科学基准。一道公开且高频重复的题目,也存在被模型逐渐熟悉的可能。但它非常适合观察短时间内的体感变化。用户无需理解复杂指标,看几只鹈鹕就能发现差异。
图:“鹈鹕杯”作品截图,标注“变笨”的作品,可以看出鹈鹕“明显不对劲”。
Open赛道不设统一提示词,参与者可以自由发挥。它更像是在测试Astra能把一个开放任务做到什么程度。
其中一个作品,最终做成了一部长达30分钟的“一镜到底”骑行故事。
整部作品共享一条1800秒时间轴和同一位骑手。地面、山川、城市、星球、车轮、羽毛和粒子全部由SVG元素组成,JavaScript只负责计算位置、关节和时间。整个项目没有使用Canvas、图片、视频、外部字体或额外的大模型接口。
镜头可以连续平移、拉远和靠近,所有场景都存在于同一个矢量世界中。为了控制性能,屏幕之外的区域暂停绘制;用户拖动进度条后,所有物件会直接恢复到对应时间点,不需要重新随机生成。
甚至连骑车这个最容易穿帮的动作也被单独处理:车轮转动和脚蹬相位由行驶距离驱动,所以人物停下来后,不会出现自行车已经停住、脚还在原地空蹬的情况。
作品前20分钟穿过30个城市和自然景点,其中深圳一章依次出现腾讯企鹅岛、深信服大厦和人才公园;后10分钟则进入宇宙,从火星一路来到太阳、冥王星、黑洞,再回到地球。
作者还专门在作品中注明哪些内容来自现实,哪些属于虚构。比如太空骑车、储存阳光的小灯、冥王星雪人,以及穿越黑洞回家,都只是故事设定;黑洞视界也没有被包装成真实可穿越的隧道。
这个作品,能看出GPT-6 Astra能力确实令人惊艳。
模型需要先理解一个开放目标,再完成页面架构、动画逻辑、时间系统、人物运动、镜头调度、场景设计、性能优化和说明文档,还要让这些部分在一个长达30分钟的作品里持续保持一致。
02 Astra为什么让大家格外敏感
CodexRadar开源项目发起人最初只是想解决自己的问题:模型今天到底有没有变笨,以及监测额度重置,可以最高效地把Token额度用足。后来,他把监测工具做成社区开源项目,没想到迅速吸引了一批重度Codex用户一起参与众测。
CodexRadar的“众测雷达”设置了112道真实开源编程题,由用户自己跑题,结果上传后再由服务器在干净环境中重新验证。官网显示,参与志愿者已经超过500人,累计贡献达到百亿级Token。
一个最初为了自己监测“模型智商”的小工具,能吸引这么多人持续贡献额度,完全是因为模型能力波动正在成为重度用户共同的痛点。
Astra上线后,这种波动变得更影响工作。
一位大模型算法工程师表示,变笨会直接影响自动化任务。“GPT-6变笨加限流,自动化任务会积累,最后出现并发冲突。工单会话如果变笨,错误还可能通过中枢传播到其他地方,最后把整个仓库搞坏。”
进入Agent阶段后,一次模型调用往往只是整个任务链的一环。如果其中某一步判断出现明显偏差,后续步骤可能继续沿着错误结果向前推进。任务越长,这种风险越明显。
也因此,当模型真正进入生产流程后,用户关心的已经不只是平均能力。能力有没有波动,同样重要。
“Astra全面得强,尤其是computer use和多agent协同管理。从雷达的数据来看,Astra的解题所需要的步骤比前代模型少了一半,越少模型越强,Astra有质变。”
OpenAI在发布Astra时,把Computer Use、专业工作、软件工程和长程Agent任务放在非常重要的位置。多位大模型领域开发者表示,“Astra是有代差的强”。
也正是因为这种强,用户希望能够把过去一些更复杂、更长程的自动化任务去交给它,所以“变笨”就会更大地影响工作的实际效果。
03 “变笨”到底变了什么
“变笨”其实是一个很社区的说法。站在用户一侧,只要同一个模型名、同一个产品入口,今天明显比昨天难用,就会被概括为“变笨”。
但从工程上看,用户最后看到的结果已经由很多层共同决定。
底层模型是一层,推理强度是一层,上下文管理是一层,Harness、Skills、工具调用、模型路由、并发调度和服务容量也都会影响最终效果。
所以用户感受到的“变笨”,并不一定意味着模型权重本身发生了变化。
比如一个Coding Agent原来会主动跑三轮测试,现在只跑一轮;原来会调用多个子Agent检查结果,现在减少了并行探索;原来可以保留更完整的上下文,现在长任务里丢失了一些早期信息。对后台而言,这些可能对应完全不同的问题,对用户而言,最后的体感都是,怎么感觉没以前聪明了。
这也是CodexRadar出现的原因。
发布时的模型benchmark分数能看出模型的峰值能力有多高,但是却很难看出模型的实时状态,比如今天上午10点调用的Astra,究竟处于什么状态。
但对于用Agent真正工作的人来说,这种实时状态十分重要。
04 “变笨”背后的问题
目前并没有公开证据能够证明,OpenAI在大规模主动把Astra替换成更弱的底模。
但Astra上线后的供给压力已经有比较明确的信号。9月10日,OpenAI暂停了每月200美元的Pro 20x套餐新订阅和升级。现有用户暂时不受影响。这个套餐提供约为Plus 20倍的使用额度,也是重度Codex用户的重要选择。
Astra本身又是一款昂贵的模型。
其API标准价格为每百万输入Token 10美元、输出Token 50美元;Fast mode可以提供更高速度,价格还会再翻一倍。
问题在于,Astra最受欢迎的能力恰好又很“烧算力”。
Computer Use需要持续理解屏幕、执行操作、观察结果,再决定下一步;多Agent工作流还可能同时启动多个子任务;Coding Agent一次完整任务,会不断读取文件、执行代码、运行测试、回看结果。
当大量重度用户同时开始这么使用模型,供给压力和过去已经完全不是一个量级。
所以这轮“变笨”讨论背后,实际混合了模型质量波动、限流、资源调度,以及长任务本身对系统稳定性的放大。
社区里有人认为,最近的问题与Astra需求过强、Pro 20x用户大量涌入和算力供给紧张有关。但OpenAI暂停20x新增订阅,至少证明了,这个前沿模型出现了很真实的供需矛盾。
过去大模型竞争更多集中在谁能训练出更强的模型。现在,训练出来之后能不能稳定地把这份智能供应给大量用户,也开始成为竞争的一部分。
05 大模型开始需要“智力SLA”
一只鹈鹕成为Agent时代的明星,说明用户在主动监控“智能”本身。模型在不同时间段的任务成功率、长任务稳定性,以及同一个workflow能否持续复现。可以把它理解成一种新的“智力SLA”。
SLA原本是Service Level Agreement,服务等级协议。云服务里通常约定可用率、延迟、故障恢复时间这类指标,比如99.99% uptime。
模型越强,这个问题反而会越突出,未来模型公司的竞争,也会从峰值能力进一步延伸到另一层:把高水平智能长期、稳定、规模化地供应出去。
模型能不能每天都一样聪明,也成为了AI Agent真正走向工作场景的一个卡点。
本文来自“腾讯科技”,作者:晓静,编辑:徐青阳,36氪经授权发布。

李明
开云体育官方始终关注游戏设计的核心要素。从角色故事到多人联机机制,我们致力于为用户提供可比较、可参考的资讯,助力每一位爱好者建立完整的知识体系。
王芳
在开云体育中国,我们相信清晰的资讯能带来更好的游戏体验。本文梳理的美术风格常见问题,配合角色故事的深度解析,让跨平台选择不再困难。