NVIDIA DGX Spark 小金盒:三万块的 AI 炼丹炉,到底值不值

目录

  1. 小金盒到底是什么?
  2. 到底谁该买?——一张图理清
  3. ComfyUI 生图:三台设备正面 PK
  4. AI 视频生成:显存黑洞的唯一解药
  5. 做 AI 短剧:三台设备终极对比
  6. John Carmack 炮轰:小金盒连一半性能都没达到?
  7. 结论:买还是不买

一、小金盒到底是什么?

NVIDIA DGX Spark(原项目名 Project DIGITS)是黄仁勋在 CES 2025 上掏出来的一个金色小方盒。巴掌大,1.2 公斤,国行售价 29,999 ~ 32,999 元

核心配置

组件 规格
芯片 GB10 Grace Blackwell 超级芯片(20 核 ARM CPU + Blackwell GPU)
统一内存 128 GB LPDDR5X(CPU / GPU 共享)
存储 4 TB NVMe 固态
AI 算力(FP4 稀疏) 1 PFLOPS(宣传值)
AI 算力(BF16 稠密) 约 125 TFLOPS(理论值)
网络 ConnectX-7 智能网卡,QSFP 光口可双机互联
系统 DGX OS(Ubuntu 定制版),预装 PyTorch / CUDA / Docker / Jupyter
功耗 标称 240W,实测高负载约 100~200W(见后文争议)

简单说,这是一台跑 Linux 的 AI 开发机,不是消费品。它没有 Windows,不兼容 x86 游戏,自己拆机换硬盘直接失去质保。

它唯一的武器就是那 128GB 统一内存——消费级显卡最高 32GB 显存,H100 也就 80GB。这意味着你可以在本地跑 2000 亿参数的大模型,或者在不 OOM 的前提下完成任何消费级显卡做不了的 AI 视频生成任务。


二、到底该不该买?一张图理清

✅ 值得买的三类人

  • 做 AI 开发/研究的: 需要本地跑大模型(70B+)、做微调、搭 Agent 流水线。云 GPU 一小时 200 元,天天跑一年回本。
  • 需要私有化部署 AI 的团队: RAG 知识库、语音助手等,全链路本地闭环,数据不出门。
  • 用 ComfyUI 做视频生成 / LoRA 训练的创作者: 这是本文的重点。

❌ 千万别买的人(99% 都在这里)

  • 打游戏的: ARM 架构跑不了 3A 大作。
  • 做 3D 渲染 / C4D 的: 同价位双路 5090D + 至强工作站强好几倍。
  • 刚入门 AI 的小白: Linux 开发机,要折腾命令行、编译 ARM 依赖、配 Docker,上手门槛极高。
  • 只跑小模型的: 玩玩 7B / 14B,随便一台 MacBook Pro 或 RTX 4060 绰绰有余。

三、ComfyUI 生图:三台设备正面 PK

市面两台常被拿来对比的一体机:Mac Studio M3 Ultra(~32,999 元 / 96GB 统一内存)和铭凡 MS-S1 MAX(~18,999 元 / AMD Strix Halo / 128GB 共享内存 / x86)。

以下数据来自 Tom’s Hardware 等机构独立实测——Flux 模型文生图,1920×1080:

设备 出图耗时 相对小金盒 价格
DGX Spark 1 分 35 秒 基准 ~32,999
铭凡 MS-S1 MAX 2 分 32 秒 慢 60% ~18,999
Mac Studio M3 Ultra 3 分 22 秒 慢 112% ~32,999

小金盒断层领先。且如果模型支持 NVFP4 量化(FLUX、Z-Image-Turbo 均已适配),速度还能再砍半。Tom’s Hardware 实测 FLUX.2 Klein 9B 在小金盒上约 60 秒一张,比 AMD Strix Halo 快了 4 倍

为什么 Mac Studio 生图拉胯?
M3 Ultra 的内存带宽(546 GB/s)远超小金盒(273 GB/s),跑 LLM 聊天时确实猛。但 ComfyUI 生图是 GPU 计算密集型任务,M3 Ultra 的 GPU 算力和 CUDA 生态跟 Blackwell 不在一个量级。铭凡同理——AMD ROCm 在 ComfyUI 里的优化远不如 CUDA 成熟。


四、AI 视频生成:显存黑洞的唯一解药

视频生成不是「快不快」的问题,是「能不能跑」的问题。

为什么是显存黑洞?

VAE 解码是真正杀手。生成 5 秒视频,VAE 把潜空间还原成帧序列——这一步显存占用爆炸式增长。哪怕模型只有 5B 参数,VAE 解码轻松吃掉 32GB+。RTX 4090(24GB)和 5090(32GB)在这里不是慢,是直接 OOM 报错退出。128GB 统一内存就是为这一关设计的。

DGX Spark 视频生成实测

模型 任务 精度 耗时
LTX-2 1280×720 / 5 秒 / 20 步 NVFP4 ~2 分钟
LTX-2.3 1280×720 / 5 秒 FP8 冷启动 ~3 分钟,热 ~1 分半
Wan 2.2 5B 图生视频 / 5 秒 / 20 步 FP16 ~8 分钟
Wan 2.2 14B 640×640 / 5 秒 FP8 911 分钟

每一条都跑通了,没有 OOM。 4090/5090 连跑都跑不了的东西,小金盒连一半内存都没用完。

LoRA 训练的维度

FLUX Dreambooth LoRA 训练,rank=256 吃掉 97GB 显存。RTX 5090 直接 OOM,只能降 rank 到 16,效果差一大截。小金盒跑 rank=256 绰绰有余。

本地 = 没有审核

云端 API(Runway、Pika、Kling)全都有内容审核。ComfyUI + Wan / LTX 完全本地化——数据不出门,没人审 prompt,没人拦输出。


五、做 AI 短剧:三台设备终极对比

维度 DGX Spark Mac Studio M3 Ultra 铭凡 MS-S1 MAX
价格 ~32,999 ~32,999 ~18,999
Wan 2.2 视频生成 ✅ 能跑,~8 分钟/条 ❌ 生态缺失 ⚠️ 兼容性堪忧
LTX-2 视频生成 ✅ 2 分钟/条,NVFP4 ❌ 不支持 ❌ ROCm 直接崩溃
ComfyUI 生图 1 分 35 秒 3 分 22 秒 2 分 32 秒
LoRA 角色训练 ✅ rank=256 ⚠️ 框架支持弱 ⚠️ rank 受限
视频后期剪辑 ❌ 无剪映/PR ✅ 最强剪辑生态 ✅ Windows 全兼容
系统稳定性 ⚠️ 固件持续修补中 ✅ 稳定 ❌ LTX 崩溃桌面

铭凡虽然便宜,但做视频赌不起——Tom’s Hardware 实测 LTX-2 在 Strix Halo 上直接崩溃了 ComfyUI 甚至 GNOME 桌面。

💡 正确姿势:生成和剪辑分离
AI 视频生成和视频剪辑是两种完全不同的负载,硬塞进一台机器只会两头妥协。小金盒负责生成素材,主力电脑负责剪——最合理的流水线。


六、John Carmack 炮轰:小金盒连一半性能都没达到?

发生了什么

2025 年 10 月底,John Carmack(Oculus VR 前 CTO)在 X 上公开开炮:

「DGX Spark 实际功耗最高只有 100W,不到标称 240W 的一半。实际算力也只有宣传值的大约一半。高负载下会烫到自动重启,怀疑上市前被暗中降级了。」

ServeTheHome 独立测试验证——CPU+GPU 双满载时功耗峰值不到 200W,没有任何负载能触达 240W。Reddit 和 NVIDIA 开发者论坛上大量用户反馈 GPU 崩溃、系统自动关机。

两个问题分开看

1. “1 PFLOPS” 是营销话术。 「1 PFLOPS」= FP4 + 2:4 结构化稀疏。换算到实际 AI 用的 BF16,理论峰值约 125 TFLOPS。Carmack 实测约 60 TFLOPS。差距存在,但不是「十几倍」——是单位不一样。

2. 功耗和散热是物理瓶颈。 GB10 芯片峰值功耗 224W,塞进巴掌大 1.2kg 盒子,散热余量极小。撞温度墙、自动降频是物理规律。

NVIDIA 修了吗?六版固件追踪

时间 关键更新
2025.11 新内核,基础稳定性修复
2026.01 电源管理优化,ConnectX-7 热插拔省 18W
2026.02 修复多台互联时的性能退化
2026.03 芯片级固件更新
2026.04 企业级部署支持
2026.06 OTA 更新机制,集群助手

CES 2026 宣称通过软件优化实现 2.5 倍性能提升、视频生成 8 倍加速。方向是明确的——固件在追。

⚠️ 两种故障要分清

  • 30W 锁死:电源管理芯片出厂缺陷,永久性,只能 RMA 换机
  • 100W 降频:散热不够导致的 thermal throttling,改善通风、更新固件可缓解

对你影响大吗?

本文所有实测数据——Wan 2.2 约 8 分钟、LTX-2 约 2 分钟——已经包含修复后的真实表现。缩水是真的,但缩了之后它依然能做完别人做不了的事。


七、结论

99% 的人不需要买。但如果你是那 1%,它没有替代品。

买小金盒的理由从来不是算力有多猛——老实说 125 TFLOPS 的 BF16 算力值三万块?5070 一张卡都敢叫板。但算力不是核心价值——是那 128GB 统一内存让它能做完别人根本做不了的事。

瘦死的骆驼比马大。OOM 的 RTX 4090 永远不如降频的小金盒——因为后者至少能跑,前者连跑的机会都没有。

买前最后三个问题

  1. 你现在有没有被显存卡过脖子? 如果连 24GB 都没用满过,别买。
  2. 你愿不愿意折腾 Linux? ARM Linux + Docker + CUDA 有学习曲线。
  3. 你是不是真的要靠它出东西? 「想试试」——省下三万块。「要量产」——它值得。
© 版权声明

相关文章