Echo's blog
Echo's blog
· 1 min read · 资讯

Qwen 3.6 27B:第一个让本地模型不再妥协的选择

开篇之前,先问一个问题:你上一次在本地跑一个真正好用的模型是什么时候?

如果你和我一样,试过 Llama 3、试过 Mistral、也试过 Qwen 2.5,大概都会有一个共同的感受——本地模型总在妥协。要么小到只能做简单的文字游戏,要么大到你的 4090 都塞不下,更别提 MacBook 了。量化之后智商断崖式下跌,写代码漏掉半行逻辑,推理像在跟一个走神的人说话。

直到我试了 Qwen 3.6 27B。

为什么说它不一样#

为什么说它不一样

阿里巴巴 Qwen 团队这次发布了两个版本:35B A3B 的 MoE 架构(更快但略弱)和 27B 的 Dense 架构(更完整更聪明,但稍慢)。真正让人眼前一亮的,是这枚 27B 的 Dense 模型

机器学习研究员 Piotr Migdał 的评价很直接:“这是第一个真正意义上作为通用智能有意义的本地模型。” 他说它 “punch above its weight”——以它的参数体量而言,表现大大超出了预期。

这听起来像套话,但我们拿数据说话。OpenCode、LiveCodeBench 上的跑分显示,Qwen 3.6 27B 在多项推理和编程测试中,已经可以和比自己大几倍的模型掰手腕。注意,这不是在云端用 8 卡 A100 跑的,这是在你的个人电脑上跑出来的分数

多重 token 预测(Multi-Token Prediction, MTP)技术是其背后的关键创新之一。简单说,以前的大模型一次只猜下一个词是什么,现在它一次能猜好几个,这让生成质量和推理连贯性都有了明显提升。你写一段 Prompt,它回复的内容逻辑更紧凑,少了很多 “呃…然后…接着…” 式的废话。

真的能跑在 MacBook 上吗?#

真的能跑在 MacBook 上吗?

看到 27B 这个数字,你的第一反应可能是:“27B 参数,我的 MacBook 吃得住吗?”

答案是吃得下,而且吃得还挺舒服。

8-bit 量化 为例,Qwen 3.6 27B 在 MacBook Max M5(28GB RAM)上可以流畅运行。实测下来,用 MLX 或 llama.cpp 推理速度大约 17-18 token/s,内存占用在 28-41GB 之间。这个速度对于日常交互、代码补全、文本生成来说已经完全可用了——你甚至感觉不到是在跑一个本地模型,它响应得够快。

如果你手头的设备显存稍紧,可以进一步量化到 4-bit,模型大小会压缩到 15-18GB 左右,速度还能更快。代价是部分能力会有一定折损,但仍然是可用的水平。

要跑起来你只需要两样东西:

  1. llama.cppMLX(二选一,后者在 Apple Silicon 上更优)
  2. 一个 8-bit 量化的 GGUF 或 MLX 模型文件

下载、加载、开聊。就这么简单,不需要配 Python 环境、不需要纠结 CUDA 版本。如果你用过 ollama,那更是 open-close-open 的事。

实测:从一个 Prompt 到完整应用#

实测:从一个 Prompt 到完整应用

理论说再多,不如直接上手。我用 OpenCode 加载了 Qwen 3.6 27B(8-bit),然后给了它一个 prompt:

“创建一个六边形的扫雷游戏,使用 HTML + CSS + JavaScript,所有代码放在一个文件中。”

我没有给任何示范代码,没有预设模板,就是一句大白话。

结果呢?一次通过。

生成的游戏界面干净、交互完整、逻辑正确。左键点击扫雷,右键标记旗子,六边形网格里数字逻辑清晰,甚至比大多数人在线找的扫雷 Demo 还要好。你能看出它理解了几何布局——六边形排列需要特殊的偏移计算,单靠背模板是做不到的。

我又试了另一个实用向的任务:“为我的 SaaS 产品生成一个落地页,包含 hero、特性展示、定价、CTA。” 这次同样是一次通过。生成的布局现代、配色协调,连响应式都做了。不是那种一眼假的 “AI 生成页面”,而是可以直接拿去用的水平。

Simon Willison 有一个经典的 “smoke test”——他让人工智能解释 “penguins on a bicycle”(企鹅骑自行车)。这个测试考验模型处理反常识情境的能力,很多模型在这里会暴露出胡言乱语的毛病。Qwen 3.6 27B 在这个测试上也表现得相当稳,这说明它的世界模型和理解力都到了相当的高度。

值的不是参数多,而是”不用再等云端”#

值的不是参数多,而是"不用再等云端"

说实话,本地模型这些年喊了太多口号。“ChatGPT 级别的本地模型” 我们听了三年,到头来还是端起手机用 Claude。

但 Qwen 3.6 27B 给人的感受不一样。它没有在参数数量上追求惊悚数字,而是在 “可运行性”“实际能力” 之间找到了一个真正的甜点(sweet spot)。

你得到的不是打折版的 GPT-4,而是一个能在你自己电脑上离线运行、不经过任何第三方服务器、不产生任何 API 费用、同时还能真正帮你做事的通用智能。它可以写代码、做推理、设计页面、处理文档——而且是认真地做事,不是半吊子地应付

很多人说本地模型的未来在于隐私和离线,但我认为更根本的价值在于 “自主权”——你不用依赖任何 API 的 SLA,不用担心服务停更、价格调整、数据外泄。你有一个属于自己的、7x24 小时随时可用的人工智能。

Qwen 3.6 27B 是第一个让我觉得 “本地模型可以了” 的模型。如果你也一直在等待那个不用妥协的选择,现在可以行动了。

去下载、去量化、去跑起来。你的电脑其实比你想象中更有潜力。

Related Posts

Comments

Copied
Copied to clipboard