$V2EX
Solana
Give SOL to Copy Address
使用 SOL 向 feeeei 打赏,数额会 100% 进入 feeeei 的钱包。
feeeei

feeeei

🏢  Golang
V2EX 第 87408 号会员,加入于 2014-12-19 14:31:24 +08:00
feeeei
分享创造  •  feeeei
为 Web3 添砖加瓦,开源我们开发的 binance-cli
2025 年 8 月 20 日  •  最后回复来自 MeiJiayun
1
问与答  •  feeeei
国庆回家的各位,你们会买点儿什么带回家吗?
2021 年 9 月 28 日  •  最后回复来自 EscYezi
9
二手交易  •  feeeei
出库克送的 Airpods,已到手 750 包顺丰
2021 年 7 月 24 日  •  最后回复来自 MiniGhost
1
二手交易  •  feeeei
Gopher China 门票转让
2021 年 6 月 20 日  •  最后回复来自 MiniGhost
2
MacBook Pro  •  feeeei
Macbook 在接显示器 USB 上行后,开机必卡白苹果
2021 年 6 月 2 日  •  最后回复来自 Gakki0118
6
问与答  •  feeeei
有没有折腾耳机升级线的老哥啊,求推荐平衡线
2019 年 2 月 19 日  •  最后回复来自 del1214
7
程序员  •  feeeei
分享一下改的 Nginx 编译安装直接开启 TLS1.3 的脚本
2019 年 1 月 29 日  •  最后回复来自 yzc27
6
feeeei 最近回复了
回复了 blackantt 创建的主题 › 似乎开源项目作者不知道/不想利用 AI 来加速自己的开发?8 月 2 日
作者问题,你换个赛道看看,你看看 OpenClaw/Hermes ,不过这俩比较极端,一天 800 个 commit...

稍微正常一点儿的,比如 sub2api ,平均一天几十个 PR ,人工肯定 Review 不过来,都是 AI 写、AI Review
@owen800q 要不就是每个员工自己订阅,要不还是买外面的中转站吧,很多号池技术还是有点儿猛...

我帮一个中转站老板修 BUG ,人家机器都是直接拉满的双路 EPYC 7702 + 1T 内存 + 10G 无限流量的配置,羡慕死了
默认是看不到的,sub2api 也不会记录会话数据,只会记录用量是为了拿来做计费用的

不过有一个 SUB2API_DEBUG_GATEWAY_BODY 的开关(默认关闭),打开这个开关之后会落盘数据,是方便 DEBUG 用的,除非还有一个外挂系统来消化处理重新汇总成会话,否则这玩意儿不会开的。

因为每次对话都是带着这个会话的全部上下文的,等于 sub2api 的网络 IO 数据全落盘,巨大...

打开 SUB2API_DEBUG_GATEWAY_BODY 开关之后,数据记录大概长这样:
========== [2026-07-29 14:03:21.482] CLIENT_ORIGINAL ==========
--- context ---
account: 12(账户名)
account_type: anthropic
model: claude-opus-4-20250514
stream: true
--- headers ---
Host: api.anthropic.com
User-Agent: claude-cli/1.0.x (external, cli)
authorization: Bearer [redacted]
anthropic-beta: oauth-2025-04-20,...
--- body ---
{
"model": "...",
"messages": [ ... ]
}
回复了 Leon6868 创建的主题 › 为什么现在 CLI agent 应用那么火, GUI 不好用吗?7 月 27 日
@honjow 哎,算了,我再苦口婆心地给你解释一遍吧。上面蒙娜丽莎其实已经讲得很清楚了,看来你还是理解不了

如果面对的是一个 GUI 客户端,大模型通常无法直接调用它的内部接口,只能通过“识别屏幕画面+模拟鼠标键盘操作”的方式进行交互,效率上就天差地别

然后这其中的图像识别就是多模态能力了啊,比如 GUI 里面有一张日志链路图表,ZCode 现在的处理方式是先调用一个 GLM-5V-Turbo 这样的支持多模态的小模型,把这张图片识别完毕之后翻译成文字,翻译成文字必然是丢失数据失真,比如:
他总结出来的内容是“这是一张日志链路追踪图,第一个节点是 xx ,第二个节点是 xxx ,每个节点分别日志是 xxx ,xxxx ,耗时 xxms”。但是有可能图片中的连线粗细表达了权重关系、线条颜色深重表达了 SLA 质量,Z 轴高度表达了调用次数等等,有可能这些信息他在翻译成文字的过程中就都丢掉了,没识别出的内容,要不就是后面的文字模型永远看不到,要不就是后续会反复一遍遍再调用 OCR 图片识别。

如果他是一个原生多模态模型,图片被存储成了图像 token 就不会有这个问题,明白了没?
回复了 Leon6868 创建的主题 › 为什么现在 CLI agent 应用那么火, GUI 不好用吗?7 月 27 日
@honjow 好的好的,你都说了“那智谱没有多模态”了,你几斤几两、什么水平已经显而易见了

无需多言,再讲什么都是在招笑话了
回复了 Leon6868 创建的主题 › 为什么现在 CLI agent 应用那么火, GUI 不好用吗?7 月 27 日
@honjow “那智谱没有多模态”这句话是谁说的,上来就说"那智谱没有多模态",还嘴这么硬... 我想问问你,你这种情况,持续多久了?
回复了 Leon6868 创建的主题 › 为什么现在 CLI agent 应用那么火, GUI 不好用吗?7 月 27 日
@honjow 你到底用没用过啊.... 啥都不懂就开始人身攻击,你不怕打脸给你打肿?!?!?

1. “那智谱没有多模态”,谁说智谱没有多模态,GLM-5V-Turbo 不知道?
2. “Zcode 是怎么用”,你到底用没用过,你没发现你上传图片他会单独调用 analyze_image tools ?你但凡用过一次看到输出就不会有这么蠢的问题,你没发现他是把图片先分析成文本再开始处理?明显就是先调用了一次 GLM-5V-Turbo 做图片识别,把输出的文字内容丢到主会话中继续处理

所以 Zcode 是通过嫁接的方式实现的图片识别,问题是很多图片通过文字表述就严重失真了,比如不管你怎么文字描述蒙娜丽莎的图片,AI 都没办法给你画出蒙娜丽莎,只有原生多模态直接图片输入的才能保持图片信息不失真,懂?

不懂就多查查,别肚子没几滴墨水就开始攻击,被打脸不尴尬吗
回复了 Leon6868 创建的主题 › 为什么现在 CLI agent 应用那么火, GUI 不好用吗?7 月 26 日
GUI 是图形化界面,考验大模型多模态识图能力
CLI 是命令行,纯文字,属于是 raw 级别交互,在所有大模型都在卷 agent 能力的今天,命令行交互属于是 AI 最基础的能力之一了
© 2026 V2EX · 22ms · 3.9.8.5