DeepSeek-V3刷屏,国产大模型一夜火爆全球,AI大佬们既破防又兴奋

12.9万
47
2024-12-27 17:40:15
1846
92
1195
556
国产大模型DeepSeek-V3以惊人的成本效率引发全球关注。这款拥有671B参数量的大语言模型,预训练过程竟然只用了 266.4 万 H800 GPU Hours,颠覆了业界对大模型研发成本的认知。通过创新的MLA架构和DeepSeekMoE技术,在14.8万亿token的训练基础上,它在代码编写和数学运算方面的表现比肩甚至超越了GPT-4o和Claude。
机器之心:专业的人工智能服务平台 合作邮箱:liyazhou@jiqizhixin.com
客服
顶部
赛事库 课堂 2021拜年纪