Key Takeaway
Qwen 3.8 27B已成可用生产力模型:即使是量化本地版,也能稳定驱动多Agent编排(调用Skill、分析需求、给子Agent下任务)。它标志着紧凑型前沿模型开始真正进入生产力场景,单位参数承载能力显著提升。
本地部署门槛大幅降低:消费级设备即可运行。Mac 24GB勉强可用,32GB是实际起点,48GB可支持更大上下文。作者计划换Mac Studio以获得更高内存带宽和更长上下文,实现日常任务的本地算力自主掌控。
模型分层与动态路由是未来方向:3B-8B负责简单任务,14B-35B负责本地内容与Agent执行,70B+负责复杂推理,万亿级负责高价值研究。这种分层才是AI普及的合理路径,而非所有任务都调用云端超大模型。
用了Qwen 3.8 27B之后,我突然想买Mac Studio了。因为我既想要更大的统一内存、更高的内存带宽,让本地模型跑得更快,同时容纳更长的上下文。我想把一部分算力掌握在自己的手里,更自由。
我目前的MacBook Pro只有48G的内存。跑4bit、MLX版的Qwen 3.8 27B,大概只有14的速度。慢归慢,但是能跑。如果用非MLX版的话,速度大概只有10,这就无法接受了。
本地跑的量化版,在性能上做了一些妥协。为了尽量排除本地量化带来的影响,我又通过OpenRouter测试了云端的高精度版本。
把Qwen 3.8 27B接入我自己的newtype OS,把每个Agent的模型都改成它。实测下来发现,这个模型完全可以驱动多Agent编排框架——能调用Skill,能分析需求,能给子Agent下达任务,等等。
说实话,我是挺惊喜的。
你要知道,这可是27B的模型,不是那些巨无霸。即使你用量化版,牺牲的性能也不多。但是,运行的门槛降却低了非常多,消费级的GPU也能跑起来。
Mac用24GB勉强能跑,32GB是比较实际的起点,48GB可以有更大上下文。如果上到M4 Max和128GB统一内存,不仅速度会快很多,也能留出更多的上下文空间,甚至同时运行多个模型。
这就是我想买Mac Studio的原因。就像我在星球里说的:本地运行,供应给Claude Code、OpenCode这些Agent,专门负责日常的任务。比如文档处理,资料搜集等等。成本低,隐私性好,没有被人拿捏的风险。
我认为,Qwen 3.8 27B一定会成为一个里程碑。它标志着紧凑型前沿模型开始成为可用的生产力模型。27B的身材证明,“达到前沿能力所需的参数规模”正在快速下降。这轮进步的背后,是单位参数承载的有效能力提高了。
如果再给一年的时间,我们很可能看到模型分层和动态路由进入大规模应用。
3B到8B的模型,负责分类、提取、改写和简单工具调用。
14B到35B的模型负责大部分的本地内容生产和Agent执行。
70B到120B的模型负责复杂推理和高价值任务。
而那些万亿参数的模型负责研究、规划、裁判等等。
这种分层和路由才是AI进一步普及的正确路径。不然所有人、所有任务都去调用云端的超大模型,这在经济和能源上都不合理。
最后,我推荐大家试试Unsloth Desktop,本地运行模型,很方便,很清爽。它会扫描、显示你机子上下载的所有模型,包括从Ollama和LM Studio下载的。你要下载什么模型也都从它那边搜索。如果要供给给Claude Code之类的Agent,运行一行命令就可以。
OK,以上就是本期内容。想了解AI,想夺回个体主权,想找到志同道合的人,就来我们newtype社群。那咱们下期见!

