快看点丨这个本地模型,让我 token 自由了
最近几个月我发现,我订阅的 token 套餐越来越多,但是 token 好像越来越不够用。
也不知道是项目多了,还是各大厂商给的 token 缩水了。
(相关资料图)
反正钱没少花,token 焦虑反而越来越大了。
直到前几天,阿里发了 Qwen3.8-27B,官方跑分直接媲美 Claude Opus 4.6,还几乎全部是在 Claude Code 上跑出来的,而且开源,随便下载,不要钱。
热度也很夸张。发布 48 小时冲上 Hugging Face 趋势榜第一,当天在 Hacker News 登顶,LM Studio 上线 38 分钟下载破万,Ollama 单渠道 5 天 36 万下载。编程工具 Cline 宣布,上线仅 4 天,它就成了 Cline 开发者选得最多的本地模型。CNBC 和 The Information 也都专门做了报道。
Hugging Face 趋势榜,Qwen3.8-27B 排第一
Ollama,vLLM,SGLang 全是 day-0 支持,连 Cloudflare 都第一时间把它收进了 Workers AI 模型库,AMD 官方也出了 Ryzen AI Max 的部署教程。这个待遇,今年在开源模型里真没见过几次。
这激发了我的兴趣,索性直接把它装进了我的 Mac,实测下它到底有没有网上评价的那么好。
1 . 先说清楚它是什么
Qwen3.8-27B,270 亿参数,稠密模型,啥意思呢,每生成一个字,270 亿参数全员上场干活,不像有些模型只派一小队人。Apache 2.0 协议开源,权重随便下载,商用也不要钱。官方给这代定的调子叫「A New Bar for Coding and Cowork」,主打就是编程和办公协作。
它还有个 2.4 万亿参数的大哥 Qwen3.8-2.4T-A95B,这次权重也一起放出来了,这是 Qwen 第一次把 Max 级别的模型开放权重。不过 2.4T 那个开放权重版是纯文本模型,不带视觉,而且那个体量普通人根本跑不动。27B 才是你能搬回家的那个。
原生多模态,能看懂图片和视频,官方口径连小时级的长视频都能理解。注意,是看懂,不是生成,想让它画图的可以散了。
本地跑边界框检测,框出照片里的鹈鹕
比如上面这个,让模型把照片里的鹈鹕一只只框出来,框得相当准。这种能力放在 agent 流程里很值钱,识图,读文档,看截图写代码,都用得上。
上下文原生 262K,官方说用一种叫 YaRN 的技术能扩展到 1M。你可以理解为,262K 是训练出来的原装量程,1M 是给尺子末尾硬接了一段估算刻度,量是能量,精度没经过校准。所以 1M 目前只是理论值,实测大家跑到的都是 262K。
2 . 为什么都在喊「本地 Opus 4.6」
Opus 4.6 发布时候的体验和断崖式领先,相信用过的人都感同身受。所以现在社区再出什么新模型,第一反应都是拿它跟 Opus 4.6 比,它就是那把尺子。
官方模型卡上的跑分确实吓人。但先说清楚,这些全是官方自己跑的分,先打对折听。
Qwen3.8-27B 官方文本跑分表
SWE-bench Pro 61.7,旁边摆的参照物是 Claude Opus 4.6 Max 的 53.4,Terminal Bench 73.0,LiveCodeBench 90.3。
多模态这边官方口径也不弱,电脑操作 OSWorld-Verified 84.3,文档理解 OmniDocBench 91.1。官方说整体能力超过自家上一代付费模型 Qwen3.7-Plus。
纸面好看归好看,实际体感怎么样?社区这几天的实测结论比较一致:日常编程和 agent 任务,它跟云端旗舰的差距已经小到要刻意分辨才感觉得出来;真正复杂的长推理任务,云端还是更稳。
我自己实测下来,模型能力确实还不错,中文写作和基础编程完全没问题,但就是速度慢,比不上云端 API,要是真实做项目,等待时间也是成本。
第三方榜单这边也出来了,Artificial Analysis 的 Agentic Index 刚把它收录进去,51 分,排第 7。
Artificial Analysis Agentic Index 榜单,Qwen3.8 27B 以 51 分排第 7
51 分什么概念,比前代 Qwen3.6-27B 的 28 分高出一大截,也压过了 DeepSeek V4 Pro 和 GPT-5.6 Luna。但它前面还站着 Claude Opus 5,GLM-5.3,Grok 4.6 三个 59 分的。所以准确的说法是,本地模型第一次挤进了这个榜单的第一梯队,离「干翻所有闭源旗舰」还差得远。
另一个专门测 agent 复杂任务的第三方榜单 Agents" Last Exam 也出分了,27B 拿到 42.9%,保住了自家旗舰 Qwen3.8-Max 八成以上的水平,压过 GLM-5.2 和 Seed 2.1 Pro。
Agents" Last Exam 榜单,Qwen3.8-27B 拿到 42.9%
注意看这张榜,27B 那一栏底下标的是什么:Claude Code。又是 Claude Code,这个点后面第 5 节细说。
3 . 27B 凭什么塞进个人电脑
这是我觉得最值得讲的部分。
传统的稠密模型,每一层都用全注意力。啥意思呢,你可以理解为模型每读一个 token 都要记一笔账,上下文越长账越厚。这个账本叫 KV cache,很多模型长上下文跑不动,是账本先爆了,不是模型本身装不下。
Qwen3.8-27B 玩了招狠的。64 层里只有 16 层用全注意力,剩下 48 层换成一种叫 Gated DeltaNet 的线性注意力,只保留一个固定大小的状态。相当于别人每笔流水都留着,它只记余额。
效果是,KV cache 大约只有同尺寸传统模型的四分之一。27B 的身板扛 262K 上下文,靠的就是这个。
另外它内置了 MTP,一次预测多个 token,你可以理解为自带一个草稿手,先打草稿再确认,速度白捡一截。
4 . 什么电脑跑得动
直接给结论:
● 24GB 显卡或 24GB 内存的 Mac。 底线入场券,跑 4bit 量化版,大约 17GB。官方还提供了 FP8 版本,一张 RTX 5090 这种消费级游戏显卡就能顺畅跑。
● 32GB 的 Mac。 舒服档,上下文也能开得长一些。
● 48GB 以上。 可以上 8bit,质量接近无损。
● 16GB 及以下的 Mac。 别折腾了,装不下。
速度上要有心理预期,但也不用太悲观,给几个社区实测的锚点:M4 Max 跑 MLX 4bit 大约 23 tok/s,M5 Max 跑优化过的 4bit 加 MTP 能到 50-60 tok/s,RTX 5090 开 MTP 甚至能冲到 90-120 tok/s。入门档 Mac 会慢一些,聊天够用,跑长任务会嫌慢。
这里有个关键变量是 MTP,开和不开速度差接近一倍,RTX 5090 上同一个版本实测从 66 tok/s 涨到 121 tok/s。代价是 MTP 会多吃显存,压缩可用上下文,所以看到谁报了个很高的速度,先问他开没开 MTP。
我自己是 M5 Max 128G,用 Ollama 跑的 4bit 版,实测大概 25 tok/s 左右,聊天和一般任务够用,跑长任务得有耐心。内存完全不是事,跑满 262K 上下文都够。
有人可能会问,4bit 和 8bit 怎么选?一句话:内存够就 8bit,嫌慢就 4bit。4bit 快接近一倍,质量损失日常聊天感知不强,但长推理任务会偶尔露怯。
5 . 配上 Claude Code,才是完全体
开头说了,官方跑分几乎全是拿 Claude Code 跑出来的,所以我认为,这模型目前搭配上 Claude Code 效果最好。
接入也简单,Ollama 原生支持:
Bash
ollama pull qwen3.8:27b-mlx
ollama launch claude --model qwen3.8:27b-mlx
Ollama 官方模型页,Applications 第一行就是 Claude Code
Ollama 官方的模型页上,Applications 列表第一行就是 Claude Code,这待遇不是所有模型都有的。
两条命令,Claude Code 的后端就换成本地模型了,现在 Claude Code 接本地模型,完全不用担心封号的问题,没有 API 费用,没有额度焦虑,agent 随便跑,token 随便烧,代码不出你自己家门。这就是我说的 token 自由。
对代码不能出内网的公司来说,这基本是目前最值得评估的方案。
提前说个体感上的关键点:拿它接 Claude Code 这种 agent,决定流畅度的其实不是生成速度,是「读档」速度。啥意思呢,agent 每干一轮活,都得把前面的聊天记录、工具结果、代码片段从头到尾重新通读一遍才能开工,轮数越多,要重读的东西越厚。
短任务聊着很顺,上下文堆到几万字之后,每一轮开工前的等待会明显变长。所以拿来当 CC 后端,内存带宽比 tok/s 数字更值钱。我自己接入后的长期体感,跑一阵子再补。
6 . 泼点冷水
新模型发布第一周,吹捧的声音都打对折听。这模型用下来,社区也发现了一些尚待打磨的细节。
国外开发者 Simon Willison 的实测可以当个佐证。默认的 xhigh 推理档位疯狂过度思考,让它画个 SVG 圆圈,它能就「要不要加同心辅助圆」这种问题琢磨半天,一张骑自行车的鹈鹕 SVG 整整想了 21 分钟,烧掉两万多个推理 token,他文章的标题直接就是「很优秀,但默认疯狂过度思考」。
Simon Willison 的实测文章,标题就是「很优秀,但默认疯狂过度思考」
鹈鹕 SVG 和那句「Was that worth waiting 21 minutes for? Absolutely not.」
同一个提示词关掉推理,两分多钟就完事。所以日常使用,建议把 reasoning_effort 调到 medium 或者 low。
社区这边还有两个真实反馈值得说。
一个是 token 消耗。国外有人把 3.8 和上一代 3.6 并排实测,答案质量 3.8 确实赢,10 个任务赢 9 个,但代价是平均 token 消耗几乎是 3.6 的三倍。
这个缺点放在本地跑倒没那么致命,反正烧的是自己家的电,但如果你打算调 API 按量计费,这个账得算清楚。
另一个是知识截止。有人问它训练数据到什么时候,它自己答 2026 年,一追问 2024 年之后的具体事就露馅。不知道自己不知道,用的时候留个心眼。
另外提醒下,agent 跑长任务记得把输出长度配额开大,官方专门提醒了这点。
1M 上下文前面说了,目前还是 PPT 数字。
7 . 谁该上车
● 手上有 24GB 以上显卡或者 32GB 以上 Mac,想不花 API 钱跑 Opus 4.6 级别 agent coding 的,直接上。
● 公司代码不能出门的,这套方案可以认真评估。
● 电脑 16GB 内存的,看看热闹就好。
● 只是日常问答写作的,你现在用的大部分普通模型就够用,不用换。
说实话,Qwen3.8-27B 现在还替代不了我的生产主力,真正做项目,我还是会打开云端。
但它的意义不在今天。
在 token 越来越不够用的时代,本地模型第一次摸到了「能用」的门槛。
按这个速度走下去,完全够格的生产级本地模型,早晚会出现。到那时候,智能不用按月订阅,就住在你自己的电脑里。
这一定是未来发展的方向,未来我们的每个电脑,每部手机都该本地常驻一个 AI 大模型,这对端侧 AI 意味着什么,不用我多说。
-
2022-05-23 16:13:32
上海奉贤等区开展常态化防疫压力测试 有序开放公交、公园、公共服务场所、公共街区商区<
本报上海5月21日电 (记者刘士安、曹玲娟)上海正在奉贤等区开展常态化防疫压力测试。在21日召开的上海市疫情防控工作新闻发布会上,奉
-
2022-05-23 16:13:32
“抗疫 宅家云课堂”,吸引沪上老同志观看50万人次<
由上海市委老干部局主办,上海市老干部大学、市科技助老服务中心承办的“抗疫 宅家云课堂”系列直播讲座自4月12日启动以来,深受老同
-
2022-05-23 16:13:32
“代跑腿”买药、开通绿色通道 丰台为管控区居民提供便捷医疗服务<
“真是太感谢了,解决了我的燃眉之急!”家住假日万恒社区的杨女士对前来送药的居委会工作人员说。 自5月17日6时起,丰台区对青塔街...
-
2022-05-23 16:13:32
上海嘉定:儿童计划免疫接种全部恢复,实行预约制<
在5月22日召开的上海市新冠肺炎疫情防控新闻发布会上,嘉定区副区长王浩介绍,从4月28日开始,嘉定在防范区逐步有序恢复老年人疫苗接种
-
2022-05-23 16:13:32
乡村振兴看新疆 | 种下红樱桃 结出“致富果”<
央广网阿图什5月22日消息(记者 罗成 通讯员 杨林)乡村振兴靠产业,产业发展靠特色。新疆阿图什市阿扎克镇麦依村积极引导农民因地制
-
2026-08-22 08:03:51
快看点丨这个本地模型,让我 token 自由了
这个本地模型,让我token自由了,编程,代码,上下文,本地模型,复杂程度,t
-
2026-08-22 08:05:57
今日快看!消息称字节豆包最快下周发布对标腾讯WorkBuddy产品
消息称字节豆包最快下周发布对标腾讯WorkBuddy产品,腾讯,字节豆包,知名
-
2026-08-22 06:03:58
宣亚国际2026年中报:营收降38.02%、净亏扩大至3335.53万元,AI基建与本地生活双线推进
,证券之星经营分析
-
2026-08-21 21:16:42
记者:巴萨签下利瓦科维奇后将其外租萨格勒布迪纳摩|讯息
记者:巴萨签下利瓦科维奇后将其外租萨格勒布迪纳摩,巴萨,西班牙,巴塞
-
2026-08-21 21:20:46
台州水务(01542)发布中期业绩 股东应占亏损4160万元 同比扩大109.05%_每日快讯
台州水务(01542)发布截至2026年6月30日止6个月业绩,该集团期内取得收
-
2026-08-21 19:50:30
获纳入恒生综指 礼邦医药-B(09637.HK)有望跻身港股通 焦点热文
8月21日,恒生指数公司公布截至2026年6月30日的恒生指数系列季度检讨结
-
2026-08-21 18:45:46
焦点短讯!中色股份:截至2026年8月10日股东总数为131,448户
证券之星消息,中色股份(000758)08月21日在投资者关系平台上答复投资者
-
2026-08-21 17:46:31
沃顿科技股东户数环比下降5.18% 今日大涨3.70%
沃顿科技8月21日披露,截至8月20日公司股东户数为33106户,较上期(8月
-
2026-08-21 17:48:07
杭州热电: 杭州热电集团股份有限公司拟购买董事、高级管理人员责任险的公告
杭州热电:杭州热电集团股份有限公司拟购买董事、高级管理人员责任险的
-
2026-08-21 16:44:28
每日头条!北京文化:上述人员未担任公司高管
证券之星消息,北京文化(000802)08月21日在投资者关系平台上答复投资者
-
2026-08-21 15:51:36
每日报道:不是只有伽玛刀:一文看懂盈康生命器械版图
提起盈康生命医疗器械,很多人最常见的认知只有三个字:伽玛刀。
-
2026-08-21 14:51:42
焦点热讯:韦东奕账号时隔一年多更新,分享“一道有趣的题”,橱窗上架“韦东奕主编小学数学练习册”,售价39.8元
8月21日,记者注意到,北京大学教师韦东奕的哔哩哔哩账号更新动态,并
-
2026-08-21 14:44:46
最新:国内商品期货收盘 主力合约多数上涨
国内商品期货收盘,主力合约多数上涨。涨幅方面,欧线集运涨超11%,碳
-
2026-08-21 12:59:18
【券商聚焦】华泰证券维持珍酒李渡买入评级 指万商联盟模式有望扩大渠道覆盖 新动态
【券商聚焦】华泰证券维持珍酒李渡买入评级指万商联盟模式有望扩大渠道
-
2026-08-21 12:51:17
讯息:佛山市新诺比进出口有限公司成立 注册资本50万美元
天眼查App显示,近日,佛山市新诺比进出口有限公司成立,法定代表人为O
-
2026-08-21 11:25:10
机构:7月电车销量显著回暖 继续看好2026年锂电超预期
机构:7月电车销量显著回暖继续看好2026年锂电超预期,批售,锂电,电车,
-
2026-08-21 11:20:16
财政部:财政金融协同促内需政策已经优化完善 8月1日起实施_热头条
财政部:财政金融协同促内需政策已经优化完善8月1日起实施
-
2026-08-21 10:03:59
情绪消费,“新”在哪里(读者点题·共同关注)
各类文创产品受到不少年轻人的追捧,平时也总在社交平台看到网友晒“拼
-
2026-08-21 10:09:16
中国女子围棋甲级联赛云顶站收官 杭州队跃居积分榜首位
人民网北京8月21日电(记者胡雪蓉)8月20日,第十三届“中信杯”中国女
-
2026-08-21 08:48:49
天天资讯:8月20日红利ETF工银基金份额减少50万份,重仓股宁德时代、美的集团、格力电器
证券之星消息,8月20日,红利ETF工银基金(159905)最新份额为10 2亿份
-
2026-08-21 07:52:40
创仕烨自动化科技(苏州)有限公司成立 注册资本88万人民币
天眼查App显示,近日,创仕烨自动化科技(苏州)有限公司成立,法定代
-
2026-08-21 07:50:26
气派科技:融资净买入283.73万元,融资余额9765.33万元
交易所最新数据显示,气派科技于2026年8月20日获融资买入1431 44万元,
-
2026-08-21 06:09:56
每日短讯:绿军续约沃尔什新赛季锋线担重任
绿军续约沃尔什新赛季锋线担重任,绿军,乔丹,总冠军,克丽·沃尔什
-
2026-08-20 22:19:15
【快播报】莫雷托:莫拉塔被推荐给拉齐奥和热那亚,但目前都不太可能
莫雷托:莫拉塔被推荐给拉齐奥和热那亚,但目前都不太可能,莫拉塔,拉齐
-
2026-08-20 22:19:13
8月20日增减持汇总:英诺激光等4股拟减持,当日暂无A股公司拟增持(表)-焦点热闻
8月20日增减持汇总:英诺激光等4股拟减持,当日暂无A股公司拟增持(表)
-
2026-08-20 20:52:11
同兴达(002845.SZ):上半年净利润1048.3万元
,格隆汇
-
2026-08-20 20:55:43
海螺水泥(00914.HK)8月20日耗资1422.35万元回购81万股A股 今日热搜
格隆汇8月20日丨海螺水泥(00914 HK)公告,8月20日耗资人民币1422 35万
-
2026-08-20 18:06:44
快资讯:恒瑞医药(01276) :SHR-7012 注射液拟用于治疗皮肤型红斑狼疮获批开展临床试验
恒瑞医药(01276)公布,近日,公司子公司广东恒瑞医药有限公司收到国家
-
2026-08-20 17:05:11
海力士奖金六成改发股票 保留现金提升股东回报 微速讯
CFi CN讯:SK海力士与韩国工会达成初步工资协议,今年员工奖金至少60%
-
2026-08-20 16:57:28
抖音客服服务升级:从“聊天指引”到“卡片即办理”,让用户办事更省心|天天快报
近日,抖音客服面向用户上线智能服务新能力,在涉及资料递交、升级办理