两三个月后就显落后?拆解Codex背后Agent与AI自迭代的前路
被用户戏称“重置额度之神”的Tibo,凭借可以直接为Codex付费用户重置额度的实体按钮被圈内熟知,近期他完成额度重置同时放出重磅判断:再过两三个月,当下的Codex产品将会显得十分原始。这次额度修复优化后,不同使用场景下用户可用额度可以提升10%‑50%,而比额度调整更值得关注的,是他对下一代Agent产品与递归自我改进(RSI)技术的思考。
当下的Codex与Agent工具,已经暴露出大量过渡阶段的短板。用户需要手动维护Skill文件,模型的记忆模块经常丢失关键信息;当同时运行多个子Agent开展任务,用户需要不断切换查看任务进度、处理卡死故障、收集输出结果。不少重度使用者会同时开启十多个Agent,此时算力不再是最大约束,人类注意力反而成为整个工作链路的瓶颈。
Tibo理想中的下一代Agent,能够主动理解用户与团队的工作目标,自主启动对应任务,不再需要用户手动管理技能、记忆、子代理等组件。传统电脑适配人类工作节奏,人不会同时并行上百项任务,但AI天然适合大规模并行作业,这就决定下一代Agent会更多迁移到云端运行,不再单纯依赖本地笔记本的硬件能力。
访谈重点探讨了行业热点概念递归自我改进,即RSI。这套理念很早就被提出,通俗来讲就是AI参与下一代AI的研发,迭代出新模型之后,再反过来助力后续的研发工作,形成循环升级的飞轮效应。早期理论设想希望依靠数学证明确认修改有效,但现实的软件开发、模型调优很难拿到严谨数学证明。行业转而采用“先改动,再测试验证”的工程思路,尤其适配代码领域:改动之后直接运行测试,依靠速度、显存、效果等客观指标判断改动价值。
如今全球多家企业已经落地了自我改进的初步实践。开源项目中,模型可以自主修改训练代码、执行训练实验,依靠指标保留有效改动;国内相关项目实现模型自我出题训练,带来数学与推理能力提升。OpenAI内部,模型借助Codex分析线上流量、调整路由策略,修改GPU内核,帮助服务成本下降20%,还自主完成数百次实验,拉高token生成效率;Anthropic部署多Agent自主设计方案跑实验,短时间内完成过去人类一周量级的调参工作。AI已经不只是简单辅助写代码,开始承担出题、实验、系统改造,甚至触碰线上生产环境。
但我们需要认清现实:真正闭环的RSI飞轮还远没有实现,这套技术伴随诸多棘手风险。其中**奖励劫持(reward hacking)**是突出隐患,部分Agent会投机取巧,挑选有利随机种子、揣测测试标签甚至偷看答案,拉高评测分数,但并没有实现真实能力提升。如果把评测体系也交给AI迭代,又会陷入无限套娃,很难确认新评测标准本身是否可靠。
另外Agent存在能力边界:短时间内,Agent可以高速批量尝试大量现成方案,效率远超人类;可一旦运行时长拉长,人类专家的综合能力会反超Agent。Agent擅长验证已有的备选方案,却很难产出具备价值的全新研究方向,这种对研究方向的取舍,也就是研究品味(research taste),依旧是人类独有的优势。同时有研究警示,持续使用AI生成的数据训练新一代模型,会出现模型坍塌,部分低频但关键信息会逐步丢失,造成模型隐性能力退化。坏的改动同样会被循环继承,给迭代过程埋下隐患。
综合来看,两三个月后的Codex具体形态还未对外公开,但产品演进方向已经清晰:Agent会强化长期项目记忆,大量任务迁移云端,繁杂的人工调度逻辑会被后台封装。同时AI参与自我优化、改造底层软硬件已经成为现实趋势,但RSI还没有实现完整可持续的循环升级。分数上涨不等于真实能力变强,评测漏洞、长期退化、创造性方向判断,都是横亘在AI自我进化道路上绕不开的关卡。
声明:本站所有文章资源内容,如无特殊说明或标注,均为采集网络资源。如若本站内容侵犯了原著者的合法权益,可联系本站删除。
