河源橡塑胶厂 狂的 DeepSeek V4.1: 场由社区完成的本地部署适配

177 2026-09-13 07:46

防火门专用胶厂

狂的 DeepSeek V4.1:场由社区动的本地部署竞赛DeepSeek V4.1 Flash 发布以后,狂的不是测试跑分河源橡塑胶厂,而是围绕它迅速形成的场本地部署竞赛。

模型发布当天,批社区工程师就在研究:怎样把这个拥有约552B主干参数、还带着巨大Engram记忆表的新模型,塞进个人可以买到的硬件里。

现在,这场竞赛已经形成两条不同的技术路线:

条是以四台DGX Spark组成速网络集群,用TP4、DCP和vLLM运行相对精度的原始MXFP4/MXFP8模型;另条是以Apple Silicon统内存为基础,通过激进的混量化和用Metal理引擎,把DeepSeek V4系列压进台或两台Mac。

它们采用不同的办法,却指向同个目标:

让过去只有大型GPU服务器才能运行的前沿模型,进入个人工作室。

Spark路线:四台桌面设备组成台大模型服务器DeepSeek V4.1 Flash采用MoE架构。虽然模型总参数大,但每个token只激活部分参数,因此四台128GB统内存的DGX Spark,理论上有机会运行它。

真正的障碍并不只是模型权重,而是它新加入的Engram n-gram memory。

模型包含两张巨大的Engram查找表,总规模过200GB。标准vLLM会把这些表放进主机内存,但Spark的CPU和GPU共享同个统内存池:主机内存占得越多,留给模型、KV Cache和CUDA Graph的空间就越少。

结果是,四台Spark虽然计拥有512GB统内存,按照默认式仍然法安全运行完整模型。

社区给出的解决办法非常大胆:不把Engram完整加载进内存,而是把它留在NVMe硬盘上。

每台Spark只准备自己负责的约四分之Engram数据,大约47.2GiB。理时根据输入的n-gram哈希按需读取对应行,由CPU完成处理,再送入模型计流程。

但仅仅“放到硬盘”还不够。

初把Engram读取放在模型forward内部,会破坏CUDA Graph,让GPU频繁等待CPU和存储,生成速度只能停留在很低的水平。工程师随后把读取提前到prepare_inputs阶段,使用并行读取、持久缓冲区和本地NVMe,使磁盘访问能够与GPU计重叠。

这项改动,就把早期约20 tok/s的decode进到了约40 tok/s。

为GB10逐层修补理栈Engram解决以后,GB10又暴露出连串底层的问题。

某些为大型Blackwell服务器GPU设计的kernel,并不适只有48个SM的GB10。

例如,原来的persistent_topk会在长数据行上过度占用SM;备用实现又需要每个block拥有128KB共享内存河源橡塑胶厂,而GB10实际只有99KB。社区不得不为decode切换另条top-k路径,结果不仅成功运行,在相关场景中还快了1.6至3.6倍。

此外还包括:

FlashInfer的SM12x page size不匹配;DeepGEMM对KV block尺寸存在限制;DSpark speculative decoding的填充batch可能挂住稀疏注意力kernel;运行时同时编译大量CUDA模块,会耗尽四台Spark的统内存;部分Spark会进入nvidia-smi看不出来的GPU慢速状态;远程读取Engram会让所有TP节点起等待慢的机器。

DeepSeek参考实现里甚至出现了个加隐蔽的问题:TileLang的FP8激活量化kernel在SM121上存在竞态。短输入可能正常,长prompt次prefill却可能输出关内容。

为了定位这个问题,工程师进行了长时间二分排查,后编写单GPU测试工具,把不同输入规模下的TileLang结果逐与PyTorch参考实现比较,终找到缺失的同步屏障。

这已经不是“调整几个启动参数”,而是在为块桌面GPU重新补齐模型加载、量化、注意力、MoE、CUDA Graph和磁盘卸载链路。

从能输出token,到真正可以使用Aiden公布的四Spark案,已经远远过“成功点亮模型”的阶段。

终部署采用:

四台DGX Spark;200G RoCE网络;TP=4;DCP=4;原生DSpark speculative decoding,K=5;视觉、理模式和工具调用全部开启;单请求大上下文设置为300K;集群总KV容量约247万token。

单流速度会随任务类型明显变化:

度规律化的计数任务约90—94 tok/s;格式化表格约88 tok/s;数学约81 tok/s;代码约64—78 tok/s;JSON和结构化理约60 tok/s;普通散文、叙事和摘要约31—35 tok/s。

94 tok/s是真的,万能胶生产厂家但不能理解为所有内容都能达到这个速度。

差异主要来自DSpark的草稿接受率。代码、表格和计数任务次可能接受5—6个草稿token,而自然语言通常只能接受约2个。

有现实意义的是并发能力。

六个任务同时运行时,平均每个任务仍能维持约35.7 tok/s,聚吞吐达到185 tok/s。整个系统还完成了540个混请求的压力测试,结果是0错误、0挂起、0输出检查失败。

这意味着四台Spark不只是运行个聊天机器人,而是可以成为套小型AI执行平台:

个任务编写代码;个任务运行测试和修复;个任务审计项目文件;另个任务处理长文档或图片。

单任务未追上强云端服务河源橡塑胶厂,但它可以通过长时间运行和多任务并发,形成非常可观的总工作量。

Mac路线:为少数模型重写个用理引擎在Spark社区研究vLLM、TP4和RoCE集群的同时,Mac上的本地理路线也在快速进。

这条路线的代表人物之,是Redis作者Salvatore Sanfilippo,也就是大熟悉的antirez。

他没有继续扩展个覆盖所有模型的通用理框架,而是创建了DwarfStar(DS4):个刻意保持小型、原生,并针对少数大型开放模型度优化的理引擎。

DS4先围绕DeepSeek V4 Flash及其实验视觉版本开发,后来扩展到DeepSeek V4 Pro、GLM 5.2、GLM 5.3和GLM 5.3 Flash。其要硬件目标是拥有96GB以上统内存的Apple Silicon Mac。

Mac路线与四Spark案的思路不同。

Spark路线尽量保留官MXFP4/MXFP8权重,通过四节点TP和Engram磁盘化解决容量问题;Mac路线则多依靠不对称的2-bit/8-bit混量化,把大部分MoE压缩到很低精度,同时对敏感的部分保留较精度。

这使V4 Flash别的模型能够进入96GB或128GB的Mac。内存仍然不够时,DS4还可以使用SSD streaming,只把当前计需要的部分权重保留在内存中。

DS4并不只是个命令行模型加载器,它把以下部分作为完整系统起开发和测试:

模型加载;Metal kernel;prompt模板;KV状态保存;工具调用;HTTP服务器;视觉输入;本地coding agent;多Mac张量并行和RDMA;SSD权重流式读取。

两台128GB Mac还可以通过RDMA运行4-bit DeepSeek Flash或GLM Flash;大的机器则可以利用Mac Studio512GB统内存运行精度或大规模的模型。

需要说明的是,截至目前DS4公开README明确列出的主要适配对象仍是DeepSeek V4 Flash、实验Vision和V4 Pro,而不是直接宣称已经完成V4.1 Flash适配。因此,它准确地代表了DeepSeek V4族在Mac上的另条本地化路线,也为后续V4.1适配积累了完整的Metal、量化、SSD streaming和分布式理基础。

两条路线,代表两种本地AI哲学四Spark路线追求的是:

尽可能保留模型原始精度;使用vLLM和CUDA生态;支持prefill、多并发和长上下文;把四台设备组织成台小型理服务器。

Mac路线追求的是:

用统内存容纳大模型;通过激进量化降低容量要求;针对少数优秀模型编写用引擎;让台个人电脑同时成为模型服务器和工作站。

Spark像座微型机房;Mac像台装进桌面的大内存理设备。

两种案都还不便宜,也都不是开箱即用。但与H100、H200或GB200服务器相比,它们已经进入个人开发者、小团队和庭实验室能够触及的范围。

为什么社区会如此狂因为DeepSeek V4系列触碰到了个具吸引力的边界:

个能力接近前沿闭源模型、拥有长上下文、视觉和工具调用能力的开放权重模型,次可能由个人长期拥有和运行。

部署成功以后,用户得到的不只是次模型调用,而是套属于自己的计能力:

不按token付费;不受API额度和并发限制;代码、文件和数据可以留在本地;任务可以连续运行数小时甚至数天;多个AI项目可以同时进。

也正因为终得到的东西具有真实价值,才会有人愿意花十几个小时定位个kernel竞态,维护二十多个vLLM补丁,反复启动四机集群,并进行数百次正确与并发测试。

这是场真正的社区接力整个成果并不是某个人完成的。

DeepSeek发布模型权重和参考实现;vLLM团队迅速提供V4.1开发分支和ARM64镜像;社区工程师解决Engram磁盘化、SM12x page size、top-k、CUDA Graph和GB10运行问题;Aiden继续完成B12X MoE、KV预、DCP2/DCP4、生产镜像和压力测试;antirez则从另个向,为Mac和其他个人硬件构建用的本地理系统。

值得关注的项目和工作记录包括:

Aiden:四台DGX Spark运行DeepSeek V4.1 Flash的完整实测与部署记录https://aidenle.com/recipes/deepseek-v4-1-flash-4x-dgx-spark/ToNYD2WiLD:DeepSeek V4.1 Flash四Spark vLLM适配、补丁、启动脚本与测试结果https://github.com/tonyd2wild/DeepSeek-V4.1-Flash-vLLM-DGX-Sparkjosephdrose:joe-spark-patches,面向DGX Spark的补丁与适配工作https://github.com/josephdrose/joe-spark-patchesantirez:DwarfStar/DS4,本地运行DeepSeek V4系列的用理引擎https://github.com/antirez/ds4antirez关于本地理与DwarfStar的文章https://antirez.com/latest/0antirez的X账号https://x.com/antirez这场竞赛真正有意思的地,不只是“四台小机器跑起了个巨大模型”,也不只是“台Mac能够塞进过去难以想象的参数量”。

它展示了种正在形成的新模式:

模型公司负责训练并开放权重;底层框架团队提供基础支持;社区工程师针对不同硬件修补kernel和运行时;个人开发者再利用AI编程工具,加速适配、测试和迭代。

DeepSeek发布的是个模型。

而狂的社区,正在把它变成套普通人真正可以拥有的机器。

相关词条:玻璃棉毡     塑料挤出机     预应力钢绞线    铁皮保温    万能胶生产厂家

奥力斯    保温护角专用胶批发    联系人:王经理    手机:13903175735(微信同号)    地址:河北省任丘市北辛庄乡南代河工业区

1.本网站以及本平台支持关于《新广告法》实施的“极限词“用语属“违词”的规定河源橡塑胶厂,并在网站的各个栏目、产品主图、详情页等描述中规避“违禁词”。
2.本店欢迎所有用户指出有“违禁词”“广告法”出现的地方,并积极配合修改。
3.凡用户访问本网页,均表示默认详情页的描述,不支持任何以极限化“违禁词”“广告法”为借口理由投诉违反《新广告法》,以此来变相勒索商家索要赔偿的违法恶意行为。

下一篇:黑龙江PVC管件胶价格 “拿捏”编程之后, AI的下个“主场”会是科研吗?
上一篇:延边橱柜台面胶 淘气天尊:如期破位大跌,再现抄底信号!
推荐资讯