qwen3.8 27B 完全被低估了,讨论度不高。
如果有人在年初跟我讲,可以用两张 3090 本地部署一个超越当时最强的 opus4.5 几代的模型,我会觉得是痴人说梦。
感觉 qwen3.8 完全可以加入穿越者套餐了,穿越之自带太阳能发电板+本地部署 qwen3.8 27B 的硬件设备,再造人类文明完全不是问题吧
如果有人在年初跟我讲,可以用两张 3090 本地部署一个超越当时最强的 opus4.5 几代的模型,我会觉得是痴人说梦。
感觉 qwen3.8 完全可以加入穿越者套餐了,穿越之自带太阳能发电板+本地部署 qwen3.8 27B 的硬件设备,再造人类文明完全不是问题吧
68 条回复 • 2026-09-22 18:02:03 +08:00
|
1
yiranw09 8 月 17 日
你指 runinfra 免费的 qwen3.8 27B ?很奇怪的是我始终无法把他接入 hermes ,一直报错 Context length exceeded (16 tokens). Cannot compress further.
|
|
2
sentinelK 8 月 17 日 没有网络检索能力的小模型就是渣。
小模型意味着信息量储备少,没有非常深厚的常识基础,或者说常识的抽象程度很高。 如果没有外部信息做支撑,很容易产生很多没有细节的“正确的废话”。 最简单的办法,你用 llama.cpp 的默认 web 应用调用一下试试看,直接就变成弱智。 能力强的小模型很像中年老板。能量大,但其实不太关注信息量和细节。他的能力都来自于和外界的串联。你把他手机收了直接降级成中年油腻老头。 相反,老版本的大模型像是老教授,不太会玩手机,所以显得很笨,很脱离现实。 |
|
5
levn 8 月 17 日
都吹成本地的 opus4.6 了,还叫低估吗
|
|
7
nguoidiqua 8 月 17 日
其实 R 站讨论热度很高的,国内玩自己部署的还是相对较少。
单看编程方面的跑分,略超 Opus 4.6 、MiniMax M3 、Gemini 3.5 ,略低于 Hy3 、Kimi K2.6 ,稍弱于 V4 Flash 0731 、Spark 1.1 、Gemini 3.7 、GLM-5.2 、Qwen3.7 Max 。(当然跑分这个东西仅供参考,各家跑分的排名都是出入较大的) 不过目前反馈有:一、过度推理,xHigh 下面推理消耗的时间和 TOKEN 比 Medium 多几倍。二、偏科严重,相比 Qwen3.6 27B ,某些方面提升很大,某些方面反而倒退了。 |
|
8
coefu 8 月 17 日 1 ,deepseek harness + qwen3.8 27B ,自己修复自己 bug ,自己给自己写插件。
2 ,联网,记忆,都让它自己写的插件。一个联网的小 case ,都还有很多搞不定。指点一条路,searxng 。记忆参考 benchmark: https://agentmemories.ai/home 3 ,Hidden Dimension: 5120 ,Number of Layers: 64 ,dense 黄金比例下,参数有限,只能靠反复推理榨出更多智力,过度推理是代价,但是本地部署,无非多几度电罢了,终归能把任务完成。从 Hidden Dimension: 8192 ,Number of Layers: 92 的 2.4T 里 蒸馏出来的 逻辑能力。就这么点参数,逻辑能力占多了,通用知识当然就少了。 |
|
9
coefu 8 月 17 日
它的对手是 早它几天开源的 Muse-Glimmer-30B ,glimmer 确实也很 ok ,但是 Hidden dimension 6656 ,Layers 52 ,比 27B 少了 12 层深度,虽然宽了点,表达更丰富。但是,在特定的领域里,比如 coding / math ,逻辑缜密性 比 表达能力更重要。这在具体任务上,通常就是 看起来在思考,但是最深层次的矛盾,总是擦肩而过,力有不逮的感觉。
glimmer 适合写小说,写剧本,一定深度的任务。 qwen3.8 是 coding 领域真正的生产力工具。 |
|
10
necZhang711 8 月 17 日
@nguoidiqua 求问,r 站是啥子
|
|
11
zhuantouer 8 月 17 日
x 上讨论挺多的,看老外的评价口碑还可以
m4 pro 试了下,10t/s 左右,的确思考过度,蹲一下他们的 moe a3b 的模型 |
|
13
1258 OP @necZhang711 reddit 呀
|
|
14
coefu 8 月 17 日
@1258 推理端,其实还有更省电的。
最屌的是 ,近存计算,在 ssd 上面焊接一个 FPGA ,把算子烧进 FPGA ,直接绕过内存墙。不过这个得看 FPGA 的算力进展了。或许也要单独供电,但是肯定也比整机功耗低。 现在瑞芯微 RK182X 系列 就是在 m.2 上面搞得 堆叠 RAM ,有 1TB 的带宽,直接悍在 FPGA 周边的。不过容量被瓶颈在 5G B ,搞不上去了。还得是看 存储厂商。 |
|
15
realJamespond 8 月 17 日
opencode 批量重构调用子 agent 没有 3.6 好用,想半天,3.6 上来就直接干活,都是 unsloth ud q6
|
|
16
tt83 8 月 17 日
阿里云为啥自己不部署这个模型,3.8 Max 还是太贵
|
|
17
acerphoenix 8 月 17 日 @sentinelK 大模型只要不部署在私网不能联网,都可以自己外接 Agent 进行网络检索呀。就是现在单纯的哪个模型也没有网络检索能力呀,都是 Agent 给的。
|
|
18
jaoyina 8 月 17 日
27b 的 coding 能力能到啥水平?
|
|
19
565656 8 月 17 日
@acerphoenix #17 有没有什么插件给 qwen3.8 联网的
|
|
20
Nzelites 8 月 17 日
27b 这么强那满血版的 3.8max 应该起飞啊 为什么好像口碑一般
|
|
21
Gylx 8 月 17 日
:)
|
|
22
ashong 8 月 17 日
7900xtx 跑 3.8 27B Q5 量化, 搭配 DS harness 效果挺好的, 比搭配 opencode“聪明”一些,输出速度 55 ~ 80t/s
|
|
23
LuoDiNate 8 月 17 日
qwen 的小尺寸一直都是神作
|
|
24
niubee1 8 月 17 日
想法不错,我已经去番茄开小说了
|
|
25
LuoDiNate 8 月 17 日
27b 到 0.8b 早就在推上被关注了
https://x.com/sudoingX/status/2033020823846674546 |
|
26
catazshadow 8 月 17 日
@coefu 跟慕斯比这两个千问是真的慢
|
|
27
ashuai 8 月 17 日
35b 怎么还不发
|
|
28
coefu 8 月 17 日
@catazshadow muse 在 llama.cpp 里,经常思考的时候,重开一个 slot ,确实比 qwen 一直用一个 slot 快。每次切 slot 都重新榨干带宽。
|
|
29
coefu 8 月 17 日
@Nzelites 2.4T 几乎没有个人有资源能跑起来,Q8 都接近 2.5TB 的参数量了。单看 模型参数,Hidden Dimension: 8192 ,Number of Layers: 92 ,92 层深度,再复杂的小说,数学推理,都能搞定。8192 的层宽,表达能力以及领域知识肯定非常丰富。
|
|
30
levn 8 月 18 日
重复和循环的问题仍然会出现。medium 思考下比前代只是略有提高所以把 xhigh 设置为了默认。同时似乎染上了 opus 4.7-5 的那种非常令人讨厌的味道。
|
|
32
restkhz 8 月 18 日
从 Qwen3.6-27B 开始“正确的废话”已经少了很多了...尤其是 3.6-27B ,答案质量比 Qwen3.5-122B-A10B 和 Qwen3.6-35B-A3B 好得多。很多时候未必需要搜索。
已经不能拿着看 Gemma4,Qwen3 的眼光看这些小模型了。Gemma4-31B 就哪怕和 Qwen3.6-35B-A3B 比能力上都完全都不是一代的,虽然发布时间接近。 3.8 不能说就是 opus4.6 的等级,有些指标差一些,有些指标超过。它知识量上和 3.6 比没很大提升,但是 Agent ,coding ,指令遵循能力已经很不错了。 我这个实验室组周六就已经玩上 Qwen3.8-27B ,FP8 。有人跑 Agent 花了 40 分钟做了 3 个网页街机游戏。我也用它问了一些现代 EDR 和 shellcode loader 有关的问题,没开搜索,回答质量也非常好。能具体说出一些现代技术而且能解释为什么要这么做,具体原理,还能给出具体 API 。体验接近 DeepSeek V4 Flash 0731 。 感觉这个东西已经到了可以当生产力工具的水平了。 至于过度推理,3.6 就有这个问题了。27B 知识不足的情况下为了更好的质量只能靠时间换空间。不过对于自己本地部署来说我认为这是值得的。这就是那个不可能三角:好,便宜,快。你不能要求你只有 32GB vram 的情况下跑出 opus 的质量,还要求它快吧... 不过确实热度不如 DeepSeek 0731. 作为一个 27B 的 dense,推理成本应该比 0731 的激活 13B 高,应该会更贵。 对于买 token 用的,和 0731 比 3.8 可能就又贵又慢了。 --------- 刚刚看了一下,artificialanalysis 给出了 52 分。 超过了 opus 4.6.直接和 DeepSeek v4 flash 0731 一个分数了。 |
|
33
wwhc 8 月 18 日
在我这测试 Qwen3.8 27B 智商比 DeepSeek v4 flash 0731 高,DeepSeek v4 flash 0731 的智力水平在 Qwen3.8 27B 和 Qwen3.6 27B/35B 之间
|
|
34
flyws 8 月 18 日 Qwen3.8 27B 确实很不错,我使用几天了,在 DGX Spark 上面的问题除了慢,还真挑不出了,对于我的一个改 PDF 的 use case ,它表现达到了 opus 水平,完成了我的要求。同样的 prompt 扔给 DeepSeek v4 Flash ,GLM 5.2 ,Kimi3 都没有做出来(都忽略了保持背景颜色一致)
我并不是想表达 Qwen 3.8 27b 暴打更大的模型,但是当我本地跑起来 Opus 级别的模型的时候,确实有一种原子弹爆炸的感觉。我觉得没有被低估,只是本地跑 AI 模型的可能还是少数,但是我相信未来这会变成大多数(都说 token 类比水电煤了,自己发电不好吗 ) |
|
35
mianma01 8 月 18 日
这个模型定价好贵啊
|
|
36
BingoW 8 月 18 日
求个建议:我目前机箱和电源( 850w )都只支持单卡,目前是 2080ti 22G 魔改,能跑 4bit 量化版本 但是 KV 不够了,上下文太短。想换卡,换 3090 24G 还是 4080s 32G 魔改呢?
|
|
38
wcwcxiaobin 8 月 18 日
@ashong 跑的什么框架速度这么快
|
|
39
m4n 8 月 18 日
这个模型如果单卡想跑 256K 上下文,最低显卡什么型号?现在价格都涨了,真搞不动
|
|
40
ashong 8 月 18 日
@wcwcxiaobin
llama.cpp + vulkan 128k 上下文, kv cache q8_0 用 DSH 分析并修改 181k 行代码的 Qt 项目 bug ,58 t/s 输入:4.5M tok 输出:29.3k tok |
|
41
ashuai 8 月 18 日
同一台 mac sudio 上用 mlx 跑的俩模型,在 mac mini 上用 dsh 评估。35b moe 还是太神了
--- # Qwen3.6-35b vs Qwen3.8-27B-4bit 全方位对比 **测试环境**:本地 oMLX(192.168.0.5:9870),真实 localai 模板(工具提示词/评分准则/审计模板),enable_thinking 关闭,共 **19 个用例 + 3 组补充测试**,两个模型同一 prompt 各跑一遍。 ## 一、性能(决定性差异) | 指标 | 35b | 3.8 | 结论 | |---|---|---|---| | 19 用例平均延迟 | **1.35s** | 3.47s | 35b 快 **2.5x** | | 审计重任务(546 token 输入) | 4.8~5.7s | 10.6~14.1s | 35b 快 **2.5~3x** | | 全程最慢单次 | 5.96s | 13.23s | 35b 无一次比 3.8 慢 | prompt 缓存两个模型都没命中(cached_tokens=0),无缓存红利差异——**3.8 的慢是纯生成速度问题**(27B-4bit 在本机 oMLX 上内核效率不如 35b)。 ## 二、功能质量 | 维度 | 35b | 3.8 | 胜负 | |---|---|---|---| | 中文对话(4 例) | 幽默更出彩("薛定谔的结论") | 比喻更生活化(餐馆点菜) | 平手~35b 微胜 | | JSON 微调用(4 例) | 全过,字段正确 | 全过,字段正确 | **平手** | | 评分(2 例) | S 级识别准确 | S 级识别准确 | **平手** | | 全量审计 | memory 密度高、低价值句丢得干净 | critical 更贴近原文、memory 偏简 | 平手~35b 微胜 | | 推理/代码(3 例) | 全对(斐波那契+复杂度/数学/找规律) | 全对 | **平手** | | 指令遵循 | 完美 3 行格式 | 完美 3 行格式 | **平手** | | 压缩记忆使用(3 例) | 正确取用 critical/memory | 正确取用 | **平手** | ## 三、工具回路(唯一的实质质量差异) | 用例 | 35b | 3.8 | |---|---|---| | 列目录 | `/fs ls .` ✓ | `/fs ls .` ✓ | | 读文件 | `/fs cat src/main.rs` ✓ | `/fs cat src/main.rs` ✓ | | 当前目录 | **`/fs pwd` ✗(无效命令,正确是 `/pwd`)** | 直接回答(系统环境里有 cwd,合理) | | 看插件 | **`/fs ls plugins/ 2>/dev/null \|\| ... \|\| /fs find ...` ✗ 编造不存在的 `/fs find` + shell 语法** | `/fs ls .` ✓ 干净 | **35b 的 CLI/shell 知识更广,但会"超纲编命令"**;3.8 严格守工具词表。不过 35b 的错误在工具回路里是**可恢复的**(无效命令会返回 usage 文案,模型下一轮会纠正),代价只是多一轮调用(~1-2s)。 ## 四、结论:推荐 **35b 继续做 default** | 决策权重 | 理由 | |---|---| | **速度(最关键)** | 本地壳的体验核心就是响应快。2.5~3x 差距是决定性的,且无法靠提示词弥补 | | 工具纪律(35b 短板) | **可修复**:base prompt 加一句"只能使用系统列出的命令,禁止发明子命令(如 /fs find)"即可;3.8 的优势代价是慢 2.5 倍 | | 其余维度 | 全部平手,不构成翻盘理由 | **给 35b 的补丁建议**(如果你采纳,我可以顺手加到 `CHAT_SYSTEM`): > "工具命令只允许使用系统列出的:fs ls/cat/write/edit/stat/log 、run 、pwd 、mode 。禁止发明不存在的子命令或混入 shell 语法(`2>/dev/null`、`||`、管道等)。" **备选方案**:如果你想留 3.8 做某些场景(比如它 critical 更贴近原文),可以让 memory 插件的审计/评分用 3.8 、chat 主对话用 35b——但按现在 2.5 倍延迟差距,审计任务用 3.8 会让记忆压缩明显变慢,我不推荐。 --- |
|
45
MistyMoon 8 月 18 日
想什么呢...
全世界最火的小模型了, Qwen3.8 27B 才出几天, 社区微调+量化加起来都 645 个了 谷歌 Gemma 4 31B 都出了这么久, 也才 548 个 睁眼看世界吧 |
|
46
volvo007 8 月 18 日 via iPhone
好家伙,我的双 A800 又能焕发青春了!
|
|
47
hongchends1 8 月 18 日
@sentinelK 你自己给它配一个 websearch 工具不就好了吗
|
|
49
ixx 8 月 18 日
接 opencode 用过吗?我咋感觉稍微让他做一个复杂点的任务就干一半直接停了,不知道是不是上下文满了,让他继续任务也继不上。。
|
|
50
Nzelites 8 月 18 日
@coefu 倒不是说跑起来的问题,而是之前还有看到不少评价不如 4.8 但是又有看到评价 4.8 不如 4.6 ()
总而言之感觉到了一定性能后 ai 的水平可能是一个比较捉摸不定的事情? |
|
51
wangxiaoer 8 月 18 日
@sentinelK #2 检索能力不是工具调用,属于应用层的吗? 和模型本身有啥关系?
|
|
52
sentinelK 8 月 18 日
@acerphoenix
@jfds @hongchends1 @wangxiaoer 你们这个上下文长度…… 楼主说:“感觉 qwen3.8 完全可以加入穿越者套餐了,穿越之自带太阳能发电板+本地部署 qwen3.8 27B 的硬件设备,再造人类文明完全不是问题吧” |
|
53
crisrock 8 月 18 日 via iPhone
有人用 MacBook 本地跑过吗?需要多少内存?
|
|
54
leonvxe 8 月 18 日
为什么总有人拿 27b 的模型和 几 T 参数的模型比,是无知还是愚昧
|
|
55
xuejianxianzun 8 月 19 日
听说很强大,但即使是程序员也只有少数人的设备能本地运行吧,所以实际作用还是有限
|
|
56
flyws 8 月 19 日
@tisswb 慢,也可以说很慢,我跑的是 ollama 的 mtp fp8 版,我没有细测,体感应该就是 10 tok/s ,加上 qwen 这一款默认比较长的思考链(但优点就是想得细致和全面),做起任务来基本都是按分钟计。dgx spark 拿来纯推理是浪费钱,但是如果你也会玩玩 pretrain 或者 finetune 的话,需要英伟达生态做实验的话,它的 tensor 算力还是合格的。而且因为 128G 显存我也拉满了上下文。
但是令我惊喜的是我等了比如 5 分钟,它真的把任务 one shot 完成了(其他更多参数的 AI 可能会 fail 同样的任务),所以目前的使用体感是只要等得起,可以基本放心交给它,我个人使用反正也不急。 跟前面某一楼提到的一样,就是水平到了这样的一个阶段,很难去评判它是比某一个模型强还是弱,但虽然很难量化,但是确实让我惊喜,会开始让我更加信任本地小模型,这在之前是没发生过的事情。昨天晚上它连上 craft agent 然后它自己 one shot 成功更新了我的定制化安装,有点厉害。 ![]() |
|
58
iv8d 8 月 19 日
参数量那么大,效果还不如那啥,没人吹了吗
|
|
59
zzutmebwd 8 月 19 日
他只是 agent 能力强,知识库比较匮乏的,毕竟参数量小,穿越还是带 glm5.2 比较稳
|
|
60
zzutmebwd 8 月 19 日
另外给个速度参考,官方 fp8 权重+fp8 kv ,vllm 0.27 ,mtp=3 ,50k 上下文长度下 prefill 5000tps decode 100tps ,其他配置就默认,基本可用,只是思考长度过长。我的显卡为 pro6000 ,如果想部署官方 fp8 至少需要两张 32G 的卡,性价比最高的应该是 4080s 32g x2 ,想好用就 5090 32g x2 ,只有 32g 显存的话就选 nvfp4 第三方量化版本,显存可能有点紧张。
mac 老老实实跑 a3b ,没必要浪费时间。 |
|
61
Geon97 8 月 19 日
看你头像 想问你 Pi 体验如何
|
|
64
qiuhang 8 月 19 日
这玩意儿养龙虾之类的是绰绰有余,甚至用来写写代码也不是不行。昨天我阿里云租了两张 L20 机器搭建了个用了半天,体感比 glm5.2 略弱,但是已经能正确理解需求以及写出代码了。在资源有限的私有化场景我觉得是个大宝贝。
|
|
66
m4n 8 月 20 日
@qiuhang 看到网上有些评测 AMD 的 Strix Halo 平台 ( ai max+395 128GB )可以跑 20 ~ 30 tokens/s, 好像属于 2W 左右凑活够得着的范围
|
|
68
coefu 4 天前
|
• 请不要在回答技术问题时复制粘贴 AI 生成的内容
