最近在试一种 Agent 工作方式:少一点 LLM 来回,多一点单回合批量命令。
测试任务是一份 15 页的东亚鱿鱼料理演示,需要同时找菜谱、图片和烹饪视频,还要确认链接、资源和多屏布局都能用。
四次运行里,直接执行组平均 10 个回合、82 次工具调用; CLI 风格组平均 13.5 个回合、10.5 次调用。某个回合一次并行做了约 20 次菜谱/视频搜索,最后核对了 10 个来源、10 个不重复视频、15 个资源和 1440 / 768 / 390 三种屏幕宽度,还修掉了一个坏地址。
只有四次运行,所以这不是“任何时候都更快”的结论;耗时有快有慢,token 的统计来源也不同。真正有用的点是:让 LLM 回合做判断,让命令做可搜索、可测试、可复查的工作。
交互任务: https://turaai.net/benchmark-task?task=east-asian-squid-recipes-slides
说明:我维护 Tura 和这套 benchmark 。你们的工作流里,有哪一步适合“模型判断一次,然后批量跑可验证命令”?
2 条回复 • 2026-08-05 08:05:42 +08:00
|
1
iintothewind 8 月 5 日
标题和正文对不上。
少调用和并行是两条不同的优化思路:一个靠减少交互次数,一个靠单回合批量塞活。前者省往返,后者省的是串行等待、代价是单回合决策变重。你标题要前者,正文吹后者,俩叠一块,既不省决策也不省理解——到底想优化哪头? 感觉逻你的引流简述的逻辑有点混乱,就不想点开看了. |
|
2
yohjisakamoto OP @iintothewind 一个 llm provider 交互有 5 个命令, 另外一个 5 个 llm proider 交互 每次一个命令共计也是 5 个命令。 少往返有问题吗? 另外说的根本不是并行 哥们。 这不是个优化。 如果你愿意了解可以花时间简单看一下理解下。我不觉得这说的不清楚。 前者的 CV cache 消耗了 5 次, 后者只消耗一次哥们。
|
爱意满满的作品展示区。