Key Takeaway
本地部署看两个核心指标:容量决定能跑多大/多高精度的模型(27B 4-bit大约需要24GB起步),带宽决定生成速度。容量大不等于带宽高,两者都要兼顾。
三种主流方案各有取舍:Mac用统一内存性价比高但带宽较低;RTX 5090(32GB高带宽)最适合单卡跑Qwen 3.8 27B或双卡做多Agent并发;RTX PRO 6000(96GB高带宽)是最完整的本地方案,适合长上下文和多模型常驻,但价格昂贵。
Qwen 3.8 27B是开源模型的DeepSeek时刻:性能好、体积小、个人可部署。它证明紧凑型模型已能成为真正的生产力工具,本地部署的门槛和价值都显著提升。
Qwen 3.8 27B就是开源模型的DeepSeek时刻。
它性能好、体积小。个人也能部署,实现很不错的效果。
最近几天,我研究了各种本地部署的方案。过程都有发在知识星球newtype里边。本期视频,我来做个总结。
在本地跑开源大模型,需要什么样的配置?重点看两个指标。
第一,容量。
也就是先看内存或显存容量。
模型运行的时候,需要把权重装进GPU显存或者统一内存。如果装不下,要么无法运行,要么就只能把部分权重放进系统内存,通过CPU或PCIe读取,那速度就会大幅下降。
用大白话说就是,内存或者显存容量决定了,你能跑多大尺寸、多高精度的模型。
举个例子,一个27B的模型,如果使用BF16的精度,那么光是权重就需要大约54GB。量化到8-bit之后,可以降到30GB左右。量化到4-bit之后,只需要17GB至20GB。
除了权重之外,系统本身、推理框架、上下文,它们都需要内存。所以,4-bit的模型,光有17GB还不够,大概得要24GB才勉强能跑。
第二,带宽。
把模型装进内存之后,第二个关键指标是内存带宽。容量决定能不能跑,而带宽决定模型生成有多快。
注意,内存容量大,并不意味着带宽就高。
比如英伟达的DGX Spark,它有128GB,比RTX PRO 6000的96GB还大。看起来很大、很划算,对吧?但是,它的内存带宽只有273GB/s,远小于RTX PRO 6000 的1792GB/s。
这么低的带宽意味着,DGX Spark虽然能装下很大的模型,但是跑大型Dense模型的时候,生成速度不会太快。它更适合MoE模型。因为MoE的总参数虽然很大,但每次生成token只激活其中一部分。
你看,我们星球里就有一个小伙伴买了两台,用来跑DeepSeek V4 Flash,速度有30多,够用了。
容量和带宽是理解本地推理最重要的两个指标,但不是全部。实际性能还会受到GPU算力、模型架构和推理框架影响。但是对于普通人来说,先抓住这两个核心指标,完全没问题。
OK,理解了原理之后,选择就容易了。我们有三个选择。
第一,Mac。
Apple Silicon用的是统一内存,也就是CPU和GPU共享同一个内存池。因此,买Mac的话,可以用相对较低的价格获得更高的内存。
但是,它的不足之处在于,带宽没那么高,只有5090和6000的一半、甚至更低。
所以,即使Mac拥有同样甚至更多的内存,在运行Dense模型的时候,速度不会太快。这个是需要取舍的地方。
第二,RTX 5090。
5090拥有32GB GDDR7显存和1792GB/s内存带宽,非常适合Qwen 3.8 27B这样的模型。
所以,如果你的目标只是本地运行Qwen 3.8 27B的话,一张5090通常比Mac Studio更合适。
如果需要多Agent并发的话,可以上两张5090。
注意啊,5090没有NVLink。非要跨卡通信的话,要走PCIe,效率不会像一块原生64GB显卡那么高。
所以,插两张卡的目的,是让每张卡都运行一个完整的模型——第一张卡处理一部分Agent,第二张卡处理另一部分Agent。它特别适合短中上下文、高并发、多Agent任务的情况。
5090虽然够快,但容量只有32GB。27B的模型没问题。如果要运行70B模型、超长上下文,或者同时常驻多个模型,那显存就不够了。这是它的不足之处。
第三,RTX PRO 6000。
这是最完整的本地AI方案。这张卡拥有96GB ECC GDDR7显存和1792GB/s带宽。
同时具备大容量和高带宽,意味着它特别适合长上下文、多模型常驻和生产级Agent服务。
而且,RTX PRO 6000还支持ECC和专业驱动,更适合长期运行。
但是,它有一个很大的不足:太贵了。你去搜一下价格就知道了。
刚才我介绍的三种方案,价格跨度非常大,从几万到十几二十万。所以,没有一种硬件在所有维度都最好,只能做取舍。
大家目前用什么配置跑本地模型?效果如何?欢迎在评论区留言。
OK,以上就是本期内容。想了解AI,想夺回个体主权,想找到志同道合的人,就来newtype社群。那咱们下期见!

