吐槽 GLM 5.3 flash:模型是真不错,生产稳定性是真灾难
这两天拿 GLM-5.3-flash 跑 agent 工作流(官方 API 直连,不是 coding plan),踩了一堆的坑:
大请求必挂。 小请求 13 秒正常回;打包 7 万 token 的请求发过去,600 秒 0 字节输出。一天四次摘要调用全部这样挂死,无一幸免。
挂死不报错。 没有 429、没有 503、没有任何错误码,就静默挂着直到客户端超时。凌晨挂 20 分钟 → 突然恢复 3 分钟 → 接着挂,像坏掉的心电图。
连坐。 主模型一 stall,摘要、标题生成全线陪葬,长会话每发一条消息都得先白等 10 分钟。高峰期还有传统艺能 429,得自己写指数退避伺候着。
日志控的绝望。 你连它卡在哪都不知道 ——no progress for 0.0s,纯服务端黑洞。
模型能力真可以,但拿它跑生产工作流的,先写好降级方案再上。