NVIDIA DGX Spark 小金盒:三万块的 AI 炼丹炉,到底值不值
目录
- 小金盒到底是什么?
- 到底谁该买?——一张图理清
- ComfyUI 生图:三台设备正面 PK
- AI 视频生成:显存黑洞的唯一解药
- 做 AI 短剧:三台设备终极对比
- John Carmack 炮轰:小金盒连一半性能都没达到?
- 结论:买还是不买
一、小金盒到底是什么?
NVIDIA DGX Spark(原项目名 Project DIGITS)是黄仁勋在 CES 2025 上掏出来的一个金色小方盒。巴掌大,1.2 公斤,国行售价 29,999 ~ 32,999 元。
核心配置
| 组件 | 规格 |
|---|---|
| 芯片 | GB10 Grace Blackwell 超级芯片(20 核 ARM CPU + Blackwell GPU) |
| 统一内存 | 128 GB LPDDR5X(CPU / GPU 共享) |
| 存储 | 4 TB NVMe 固态 |
| AI 算力(FP4 稀疏) | 1 PFLOPS(宣传值) |
| AI 算力(BF16 稠密) | 约 125 TFLOPS(理论值) |
| 网络 | ConnectX-7 智能网卡,QSFP 光口可双机互联 |
| 系统 | DGX OS(Ubuntu 定制版),预装 PyTorch / CUDA / Docker / Jupyter |
| 功耗 | 标称 240W,实测高负载约 100~200W(见后文争议) |
简单说,这是一台跑 Linux 的 AI 开发机,不是消费品。它没有 Windows,不兼容 x86 游戏,自己拆机换硬盘直接失去质保。
它唯一的武器就是那 128GB 统一内存——消费级显卡最高 32GB 显存,H100 也就 80GB。这意味着你可以在本地跑 2000 亿参数的大模型,或者在不 OOM 的前提下完成任何消费级显卡做不了的 AI 视频生成任务。
二、到底该不该买?一张图理清
✅ 值得买的三类人
- 做 AI 开发/研究的: 需要本地跑大模型(70B+)、做微调、搭 Agent 流水线。云 GPU 一小时 200 元,天天跑一年回本。
- 需要私有化部署 AI 的团队: RAG 知识库、语音助手等,全链路本地闭环,数据不出门。
- 用 ComfyUI 做视频生成 / LoRA 训练的创作者: 这是本文的重点。
❌ 千万别买的人(99% 都在这里)
- 打游戏的: ARM 架构跑不了 3A 大作。
- 做 3D 渲染 / C4D 的: 同价位双路 5090D + 至强工作站强好几倍。
- 刚入门 AI 的小白: Linux 开发机,要折腾命令行、编译 ARM 依赖、配 Docker,上手门槛极高。
- 只跑小模型的: 玩玩 7B / 14B,随便一台 MacBook Pro 或 RTX 4060 绰绰有余。
三、ComfyUI 生图:三台设备正面 PK
市面两台常被拿来对比的一体机:Mac Studio M3 Ultra(~32,999 元 / 96GB 统一内存)和铭凡 MS-S1 MAX(~18,999 元 / AMD Strix Halo / 128GB 共享内存 / x86)。
以下数据来自 Tom’s Hardware 等机构独立实测——Flux 模型文生图,1920×1080:
| 设备 | 出图耗时 | 相对小金盒 | 价格 |
|---|---|---|---|
| DGX Spark | 1 分 35 秒 | 基准 | ~32,999 |
| 铭凡 MS-S1 MAX | 2 分 32 秒 | 慢 60% | ~18,999 |
| Mac Studio M3 Ultra | 3 分 22 秒 | 慢 112% | ~32,999 |
小金盒断层领先。且如果模型支持 NVFP4 量化(FLUX、Z-Image-Turbo 均已适配),速度还能再砍半。Tom’s Hardware 实测 FLUX.2 Klein 9B 在小金盒上约 60 秒一张,比 AMD Strix Halo 快了 4 倍。
为什么 Mac Studio 生图拉胯?
M3 Ultra 的内存带宽(546 GB/s)远超小金盒(273 GB/s),跑 LLM 聊天时确实猛。但 ComfyUI 生图是 GPU 计算密集型任务,M3 Ultra 的 GPU 算力和 CUDA 生态跟 Blackwell 不在一个量级。铭凡同理——AMD ROCm 在 ComfyUI 里的优化远不如 CUDA 成熟。
四、AI 视频生成:显存黑洞的唯一解药
视频生成不是「快不快」的问题,是「能不能跑」的问题。
为什么是显存黑洞?
VAE 解码是真正杀手。生成 5 秒视频,VAE 把潜空间还原成帧序列——这一步显存占用爆炸式增长。哪怕模型只有 5B 参数,VAE 解码轻松吃掉 32GB+。RTX 4090(24GB)和 5090(32GB)在这里不是慢,是直接 OOM 报错退出。128GB 统一内存就是为这一关设计的。
DGX Spark 视频生成实测
| 模型 | 任务 | 精度 | 耗时 |
|---|---|---|---|
| LTX-2 | 1280×720 / 5 秒 / 20 步 | NVFP4 | ~2 分钟 |
| LTX-2.3 | 1280×720 / 5 秒 | FP8 | 冷启动 ~3 分钟,热 ~1 分半 |
| Wan 2.2 5B | 图生视频 / 5 秒 / 20 步 | FP16 | ~8 分钟 |
| Wan 2.2 14B | 640×640 / 5 秒 | FP8 | 911 分钟 |
每一条都跑通了,没有 OOM。 4090/5090 连跑都跑不了的东西,小金盒连一半内存都没用完。
LoRA 训练的维度
FLUX Dreambooth LoRA 训练,rank=256 吃掉 97GB 显存。RTX 5090 直接 OOM,只能降 rank 到 16,效果差一大截。小金盒跑 rank=256 绰绰有余。
本地 = 没有审核
云端 API(Runway、Pika、Kling)全都有内容审核。ComfyUI + Wan / LTX 完全本地化——数据不出门,没人审 prompt,没人拦输出。
五、做 AI 短剧:三台设备终极对比
| 维度 | DGX Spark | Mac Studio M3 Ultra | 铭凡 MS-S1 MAX |
|---|---|---|---|
| 价格 | ~32,999 | ~32,999 | ~18,999 |
| Wan 2.2 视频生成 | ✅ 能跑,~8 分钟/条 | ❌ 生态缺失 | ⚠️ 兼容性堪忧 |
| LTX-2 视频生成 | ✅ 2 分钟/条,NVFP4 | ❌ 不支持 | ❌ ROCm 直接崩溃 |
| ComfyUI 生图 | 1 分 35 秒 | 3 分 22 秒 | 2 分 32 秒 |
| LoRA 角色训练 | ✅ rank=256 | ⚠️ 框架支持弱 | ⚠️ rank 受限 |
| 视频后期剪辑 | ❌ 无剪映/PR | ✅ 最强剪辑生态 | ✅ Windows 全兼容 |
| 系统稳定性 | ⚠️ 固件持续修补中 | ✅ 稳定 | ❌ LTX 崩溃桌面 |
铭凡虽然便宜,但做视频赌不起——Tom’s Hardware 实测 LTX-2 在 Strix Halo 上直接崩溃了 ComfyUI 甚至 GNOME 桌面。
💡 正确姿势:生成和剪辑分离
AI 视频生成和视频剪辑是两种完全不同的负载,硬塞进一台机器只会两头妥协。小金盒负责生成素材,主力电脑负责剪——最合理的流水线。
六、John Carmack 炮轰:小金盒连一半性能都没达到?
发生了什么
2025 年 10 月底,John Carmack(Oculus VR 前 CTO)在 X 上公开开炮:
「DGX Spark 实际功耗最高只有 100W,不到标称 240W 的一半。实际算力也只有宣传值的大约一半。高负载下会烫到自动重启,怀疑上市前被暗中降级了。」
ServeTheHome 独立测试验证——CPU+GPU 双满载时功耗峰值不到 200W,没有任何负载能触达 240W。Reddit 和 NVIDIA 开发者论坛上大量用户反馈 GPU 崩溃、系统自动关机。
两个问题分开看
1. “1 PFLOPS” 是营销话术。 「1 PFLOPS」= FP4 + 2:4 结构化稀疏。换算到实际 AI 用的 BF16,理论峰值约 125 TFLOPS。Carmack 实测约 60 TFLOPS。差距存在,但不是「十几倍」——是单位不一样。
2. 功耗和散热是物理瓶颈。 GB10 芯片峰值功耗 224W,塞进巴掌大 1.2kg 盒子,散热余量极小。撞温度墙、自动降频是物理规律。
NVIDIA 修了吗?六版固件追踪
| 时间 | 关键更新 |
|---|---|
| 2025.11 | 新内核,基础稳定性修复 |
| 2026.01 | 电源管理优化,ConnectX-7 热插拔省 18W |
| 2026.02 | 修复多台互联时的性能退化 |
| 2026.03 | 芯片级固件更新 |
| 2026.04 | 企业级部署支持 |
| 2026.06 | OTA 更新机制,集群助手 |
CES 2026 宣称通过软件优化实现 2.5 倍性能提升、视频生成 8 倍加速。方向是明确的——固件在追。
⚠️ 两种故障要分清
- 30W 锁死:电源管理芯片出厂缺陷,永久性,只能 RMA 换机
- 100W 降频:散热不够导致的 thermal throttling,改善通风、更新固件可缓解
对你影响大吗?
本文所有实测数据——Wan 2.2 约 8 分钟、LTX-2 约 2 分钟——已经包含修复后的真实表现。缩水是真的,但缩了之后它依然能做完别人做不了的事。
七、结论
99% 的人不需要买。但如果你是那 1%,它没有替代品。
买小金盒的理由从来不是算力有多猛——老实说 125 TFLOPS 的 BF16 算力值三万块?5070 一张卡都敢叫板。但算力不是核心价值——是那 128GB 统一内存让它能做完别人根本做不了的事。
瘦死的骆驼比马大。OOM 的 RTX 4090 永远不如降频的小金盒——因为后者至少能跑,前者连跑的机会都没有。
买前最后三个问题
- 你现在有没有被显存卡过脖子? 如果连 24GB 都没用满过,别买。
- 你愿不愿意折腾 Linux? ARM Linux + Docker + CUDA 有学习曲线。
- 你是不是真的要靠它出东西? 「想试试」——省下三万块。「要量产」——它值得。