长程调度,Agent Loop,这两个词,圈里喊了大半年,你随便刷个技术社区都能看到
乍一听挺唬人。翻译过来其实就一句话:让 AI 自己把一件大事,拆成很多步,一步一步做完,中途还记得自己为啥在干
这几个月,DeepSeek、Kimi、Qwen 都在验证这条路线。今天智谱也发了GLM-5.3


官方说,通过通过极致的后训练 Scaling:数十倍的长程任务环境、更丰富多样的环境类型、超长的后训练时间,大大提高了模型的智能上界
借着这一次GLM-5.3发布,那我们也来拆一拆,看看长程调度究竟又是用,如何自己上手写一个「长程调度」提示词
话不多说,直接开测
01 先翻译成人话
BASIC CONCEPT / AGENT LOOP
Agent Loop就是 AI 自己「干活 → 看结果 → 再决定下一步」,循环很多轮,直到把事做完。通俗点就是 AI 学会”自己干活”,不用每走一步都等你指挥
而长程调度(Long-Horizon)指的就是为了完成这个目标,AI要自己能分成很多步、跨很多轮、还得一直记得自己干到哪了
它的难点很在于:
第 1 步错了,第 10 步就废,错误会一路滚雪球(漂移 shift)
中间经常没人告诉它对不对,走很远才发现方向错了
干到第 20 轮,还得记得第 3 轮说过的话
所以长程任务一直是模型的软肋:上下文有限,历史越滚越长,模型要么”失忆”,要么忘了自己为什么在干。
以前比”谁答得聪明”,现在比”谁能把事做完”。能把几十步的活稳稳干完、干砸了能自己恢复的模型,才配碰真实业务。
02 实测:让 GLM-5.3 自己循环跑
FIELD TEST / GLM-5.3
CASE 01
从 0 到 1 复刻传奇
第一个 case,我让它从 0 到 1 复刻经典游戏《传奇》,不过主题换成了《摸鱼小李》。第一轮跑出来还挺糙的,就是个能动的demo。

但整整 循环了7 轮之后,我拿到了下面这个能真正玩下去的《摸鱼传奇》:沉浸感拉满,设定完整,等级、天赋、装备、BOSS 一个不少。


更带劲的是过程。每一轮它都会回头看原版《传奇》是怎么做的,再接着往下打磨,一轮比一轮完整。

CASE 02
像素消灭怪物
本来以为《摸鱼传奇》已经够好玩了,结果 GLM-5.3 又给我整了一个闯关游戏,「地图、打怪、爆装备、升级、装备强化、Boss」一个不落全凑齐了。说实话,有点上头。


而这只是GLM-5.3跑了六个循环的结果,整个游戏系统机制非常详实完善。整个游戏系统机制详实又完善。

说实话,我水群的时候看到有人复刻了一版《泰拉瑞亚》,再回头看它六个循环做出来的东西,这个效率是真的有点夸张。

CASE 03
模拟经验放置游戏
这个游戏很唯美,模仿的是小时候玩的放置经验类游戏。可以看到 GLM-5.3 的审美也是很好的。

可以放置大本营,点击单元格进行建设(农田、工厂、电站…),这类游戏最大的问题是,玩到后期有点手忙脚乱😂 每一个单元格太多点不过来。


CASE 04
红蓝网络攻防
除了编程,官方这次还提了一嘴网络安全。GLM-5.3 在漏洞识别上已经追平第一梯队(CyberGym 84.5%,跟 Mythos 5 基本持平)
既然 GLM-5.3 这么牛,那我有点好奇,如果让他们俩分别进行网络攻防,会怎么样?
于是我让 GLM-5.3 分别扮演红蓝两队进行攻防,这是最终的记录可视化:


除此之外,我还做了侦探推理游戏、探险迷宫游戏:



03 没有视觉,但底层是真强
MODEL LIMIT / VISUAL
现阶段 GLM-5.3 最大的痛点。它目前是纯文本模型(单模态),没有视觉模型,看不了图也造不出图。唐总 6 月公开征集意见时,评论区刷屏最多的就是”视觉”,说的正是这件事。
别的 AI 模型在 Agent Loop 的时候,还可以截图一下,查看状态,根据截图修正下一步。(注:还有一个原因是我用的Claude Code,在官方 ZCode Harness 中,会调用 GLM 4.6V 充当 5.3 的「眼睛」)
但视觉之外,它的编程能力和系统架构能力是真的强。而且这一次即便没有视觉,很多前端都做的很好看。
做仿《传奇》那个 case:它会自己去找《传奇》的相关网站、分析它的游戏引擎是怎样的,然后基于这个引擎帮我做。它真去研究了参考对象再动手,没瞎写。
这活儿放在人身上,得叫”系统架构师”。

04 设计loop提示词
PROMPT DESIGN / LOOP
我翻了 Anthropic 的《Building Effective Agents》、LangChain 的《The Art of Loop Engineering》和 Steve Kinney 的《Anatomy of an Agent Loop》,又看了看社区里大家踩坑的讨论,总结了五条建议:
STEP 1
让它把进度存下来
干到一半崩了、断了,得能接着干。
办法很简单:让它每做完一轮,就把进度写进一个文件。长程任务最容易死在两件事上:一口气想干完全部(聊天记录撑不住),或者干一半没存档(重启后啥都不记得)。
STEP 2
告诉它要循环,还得告诉它现在第几轮
在提示词里写清楚:你会多轮干活,每轮都是先想、再做、记录、然后决定要不要继续。同时告诉它现在跑到第几轮了,它才知道自己走了多远,不然干着干着就忘了自己在哪。
STEP 3
提前说好什么时候停
做完了停、到最大轮数停、你喊停,都得写清楚。一般 15 到 25 轮就够,到顶了就让它把手头做完的部分整理好交出来,别硬着头皮继续跑。
STEP 4
报错是好事,让它带着报错接着改
跑出来的报错、失败的命令,别让它当没看见。让它记下来,下一轮换个思路再试,而不是同一个招数反复撞墙。
STEP 05
聊太长了要精简,但有删法
干到后面聊天记录越来越长,必须精简。精简时只删重复的中间过程,留下它做过的决定、还没解决的问题、下一步计划。删太多它会失忆,留太多费钱还乱。
一句话总结:Loop 的关键不是提示词写得花哨,而是把这四件事设计好:状态能存、知道什么时候停、会从报错里学、会精简记忆。模型只是在这个轨道上跑。
写在最后
整体跑下来,GLM-5.3 给我的整体体感是:底子是真强
而且官方给的数据也撑得住这个判断:编程能力较上一代提升约 50%,Terminal-Bench 3.0 做到开源模型第一,自研 Code Bench 还超过了 Claude Opus 4.8,token 也花得更少
编程和系统架构能力在线,能长时间自主干活、反复验证、把项目推进到可交付
但话也得说回来:
单模态无视觉是它现在的短板,Agent Loop 的「视觉」需要 GLM 4.6V补上
复杂工程的细节、后端和数据库,最后还是要自己把关一遍
权重要等两周后才开源(先做安全加固),API 也是刚上线
至于为什么智谱(国内其他家也一样)都在卷长程调度、Agent Loop,因为这事的本质,是模型从「会写」走向「会完成」的最后一公里
单轮问答拼的是聪明,长程交付拼的是靠谱;而靠谱,恰恰是 AI 从 demo 走进生产环境的门票。谁先把这件事做完,谁就拿到企业真实业务的入场券
本文由作者@摸鱼小李,授权发布于平台,未经许可禁止转载。

