sampeng
V2EX  ›  分享发现

jev 的类似开源这两天都爆了,测了一下 laya

By sampeng at 7 天前 · 961 次点击
因为我把 jav 扩展到了自动选择 thinking 的等级,想看看效果。
然后就突发奇想,我已经用了 1 年的 vb 了,积攒了大量的 jsonl 。于是让 astra 来进行抽取 10000 条符合可以做 thinking 判定的。但是太多了,我怕 astra 给我标记了。先抽取出 200 条来做一个基线。用 astra 和 sol 进行独立评分,然后喂给 jev 看看 jev 的结果情况(这是不是就是蒸馏 astra 。。。)。。因为我打算直接拿这个来训练微调 laya 。

看结果不是很好


| 指标 | Laya 多语言版 | 翻译+ Laya 英文版 | Jev |
|---|---:|---:|---:|
| 与共识等级一致 | 22.6% | 38.7% | 68.5% |
| 最多相差一档 | 53.2% | 76.6% | 96.8% |
| 判低两档及以上 | 52 条 | 5 条 | 1 条 |
| 总延迟中位数 | 71ms | 3.19 秒 | 377ms |

jev 肯定是有大量的判例来进行训练的,不是一蹴而就的。laya 的 readme 也说了他裸跑不如 jev ,但是根据训练进行特化微调训练,是可以达到甚至超过 jev 的。

我打算试试看看效果。

case1.更换底模
case2.用微调。

这个东西值得研究的价值在于在某一个小的领域等于 SOTA 的效果。还是很有价值的。。。我刚就在想。

大模型在 agent 的 loop 中前期要暴力思考使用 read/grep 工具来探索,有时候这个就要 1-2 分钟,如果这个 1-2 分钟缩短到 5 秒内。是不是有显著的帮助,当然这只是探讨。。也不是专业搞这个的。
目前尚无回复
© 2026 V2EX · 21ms · 3.9.8.5