我最近就发现,即使聪明如 Fable 5,如果你只是给它一个目标让它优化,它可能也就是在既定的框架下想办法帮你优化到极致,但是它很难跳出既定框架,发现一条完全不同的路线。
比如说最近有用户反映使用 BaoCut 转录速度慢,我就反复的用 Codex 去转录视频,然后让 Codex 或者 Fable 去分析瓶颈在哪里,该怎么优化,然后每次它们都能给我一堆理由和看起来靠谱的优化方案。
比如它会建议多开启 workers(subagent),对 workers 预热之类。让它按照方案优化后,似乎有效果但是又不明显。
最后还是自己去分析数据包,发现耗时长还是输出的 JSON 格式太长了,导致生成、校验时间较长。
如果不用 JSON 格式,比如纯文本,或者简单的 html 格式,会更节约 token,只不过这样程序解析会很复杂,比如对字幕润色分段,输出是纯文本的话,就要做 diff 比较润色后更改的内容,还要把变更后的部分,重新对应到原始字幕的单词上。
简单来说,就是以前为了让程序简单就让模型输出复杂更费 token;如果要节约 token,就可以让模型的输出简单,但是程序解析会很复杂。
按照这个思路改进后,效果很明显(对比图2图3),调用次数从 33 次降低到 12 次;时间从 31 分钟降低到 18 分钟。测试张小珺那期将近 7 小时的访谈,完整润色也只需要 42 分钟。
如果不走 Agent 走 Cloud 模型的话,一个小时的视频,完整的翻译校对成双语字幕,用 DeepSeek v4 Flash,成本大于是 ¥0.4元。
有兴趣可以试试看效果,Mac 有专门的 App,Windows 支持 cli 或者 skill。
BaoCut :https://t.co/89Wi1b3hZT
点击图片查看原图
点击图片查看原图
点击图片查看原图
点击图片查看原图