论坛风格切换
 
  • 帖子
  • 日志
  • 用户
  • 版块
  • 群组
帖子
购买邀请后未收到邀请联系sdbeta@qq.com
  • 145阅读
  • 0回复

[业界新闻]英伟达刷新 DeepSeek V4 推理纪录:单 Token 成本降至 1/5,AI 吞吐量最高提升 20 倍 [复制链接]

上一主题 下一主题
 

发帖
12562
今日发帖
最后登录
2026-08-29
只看楼主 正序阅读 使用道具 楼主  发表于: 2026-07-01 14:56:00
英伟达昨日(6 月 30 日)发布博文,宣布在英伟达 Blackwell 平台上,通过优化全栈推理,相比较 DeepSeek V4 模型 1 个月前上线初期,单 Token 成本最多降至五分之一。 6bO~/mpWT~  
^,8R,S\} $  
单 Token 成本(Cost Per Token)指模型生成或处理单个 token 的成本指标,常用于比较不同硬件、软件栈或部署方式的推理成本表现。 aFj.i8+  
K@u&(}  
英伟达在博文中表示已将单 Token 成本列为 AI 总拥有成本的核心指标,并表示针对 DeepSeek v4 模型,Blackwell 平台已将其降低至行业最低水平。 ..W-76{  
bzZ>lyH  
在技术实现方面,英伟达通过生产运营层、应用加速层、基础设施访问层 3 层来优化推理: X~9j$3lUBR  
ZcE_f>KV  
    生产运营层负责分布式服务、编排、自动扩缩容和内存管理; 1zxq^BI  
YT#3n  
    应用加速层负责运行时优化,如计算与通信重叠、内核融合; Q \hY7Xq'  
nY%5cJ`"  
    基础设施访问层负责调用 GPU、网络、内存与系统能力。 hT g<*  
0&+k.Vg  
性能方面,英伟达通过分离式服务、大规模专家并行、基于 NVIDIA NVLink 的并行通信、NVFP4 精度以及多 token 预测等技术,叠加优化后,Blackwell 平台单 GPU 的 token 吞吐量最高可提升 20 倍。 'tgKe!-@  
_fk#<  
7[#yu2  
YwEpy(}hJm