边缘 AI 推理:FP32 到 INT8 量化的实战经验

工业视觉检测、智能安防、可穿戴设备——这些场景的共同点是 AI 推理必须跑在本地。原因很实际:网络延迟不可控、数据不能出域、功耗有上限。拿一颗 Cortex-A7 @ 1GHz 的 SoC 来说,可用...
23小时前
30

Kubernetes 多集群管理:AI 平台跨集群调度的工程实践

多集群管理不是架构的炫耀,而是当单集群的物理边界和运维边界被突破后的务实选择。核心原则是按 GPU 类型做资源分区,通过统一的调度器和模型注册表实现部署编排,通过 Envoy 实现流量编排。落地建议...
24小时前
20