
宝子们👋,今天来聊聊 AI 大模型领域超火的 DeepSeek!前两年 AI 军备竞赛那叫一个激烈,科技巨头们碳排放蹭蹭涨,谷歌温室气体排放量自 2019 年增长 48%,微软二氧化碳排放量也增加近 30%,都说是 AI 模型、硬件和数据中心能耗攀升惹的祸,人类仿佛要陷入能源危机。

🌟AI 投资热潮降温,DeepSeek 带来新曙光 不过最近剧情大反转,微软取消俩数据中心项目,终止租赁协议还暂停国际资本支出计划,市场都在说 AI 投资热潮降温了。这时候 DeepSeek 闪亮登场✨,它就像一条 “鲶鱼”,改变了 AI 企业算力预期,还极大削减未来 AI 算力可能带来的能源消耗。

🔍DeepSeek 如何降低能源消耗? 灵碳智能创始人李博杰揭秘,DeepSeek 主要从这 4 个方面降低训练成本:
流水线并行优化(DualPipe):前向传播和反向传播交错执行,让 GPU 利用率拉满,减少等待时间。
冗余专家策略的负载均衡器(EPLB):在 MoE 架构下,给繁忙专家复制分担负载,不让 GPU 闲置。
FP8 混合精度训练:广泛采用 8 位浮点数,内存与计算资源消耗大幅降低。
多令牌预测(MTP):一次生成多个 token,提高训练和推理效率,缩短训练时间。
具体到 GPU 耗能,DeepSeek 预训练和强化学习阶段合计约 3.16 百万 GPU 小时,用 H800 GPU 算,总能耗约 1.9 GWh。对比 GPT - 4 Moe,用了 8000 个 H100 GPU 训练 90 天,总能耗约 10.4GWh,是 DeepSeek 的 5 倍!节约的电能够近一万个家庭用一年呢。

🌱间接能源减耗空间巨大 DeepSeek 技术创新不仅直接减耗,间接带来的减碳空间也超惊人。市场竞争层面,meta 都慌了,成立多个 “作战室” 剖析 DeepSeek 改进 Llama。马斯克的 Grok 3 虽然评分高,但能耗巨大,DeepSeek 能耗效率低 67%。微软、meta 纷纷转向或研究 DeepSeek,它正在颠覆堆算力模式。 供应链上下游角度,DeepSeek 出圈后能源供应商股价下跌。国际专家都说它颠覆了能源领域,改变了人工智能带动能源需求增长的假设。而且在传统能源企业赋能上,DeepSeek 表现也超棒,化工企业通过它优化工艺,蒸汽消耗降低,产品收率提升。中石化的 DeepSeek - R1 模型推理计算效率提升近一倍。 🎉更广泛的社会效益 DeepSeek 在 ESG 中的 “S(社会)” 和 “G(公司治理)” 也表现出色。在 “G” 层面,微信、百度等接入,各地政务系统上线 DeepSeek - R1 智能模型,算力需求大增。在 “S” 层面,广西玉林乡镇用 DeepSeek 进行防返贫监测,分析效率提升 50%。