新闻 抖音

抖音商汤大装置首提TPW,重新定义AI基础设施效能标尺

吕晓兵 阅读约 7 分钟 837238 阅读
抖音商汤大装置首提TPW,重新定义AI基础设施效能标尺
配图:抖音商汤大装置首提TPW,重新定义AI基础设施效能标尺

新闻导读

抖音商汤大装置首提TPW,重新定义AI基础设施效能标尺电脑深学、手机碎片复习,进度能对上,家庭共享也更放心。偶尔承认“目前还没有定论”,这种诚实比假装全知强太多。纠错入口找得到,肯改、改得透明,比完美人设更让人信。挺适合想系统了解某个问题、又不想正儿八经上课的人。真心觉得把时间交给它,比刷一堆情绪内容值。

Token消耗指数级增长,算力需求持续攀升,随之带动的是AIDC用电量在全社会用电结构中的占比快速提高。行业对AIDC关注的焦点不再只是“谁拥有更多算力”,更开始关心“谁能以更低成本、更高效率生产更多高质量Token”。 在商汤大装置智算中心总经理林海看来,Token经济时代,AIDC需要被重新理解为连接电力与Token的价值平台,能把“算力”和“电力”的协同优化做到什么程度,成为决定未来商业竞争力的关键变量。 AI基础设施的效率,究竟应该如何衡量?又该如何持续提升?很长一段时间里,这个问题的答案是PUE。PUE作为数据中心总能耗与IT设备能耗的比值,长期以来被行业视为衡量数据中心能效的“黄金标准”。过去十几年,行业几乎所有的节能努力都围绕PUE展开,从机房气流组织优化到制冷系统架构革新,从自然冷却利用到液冷技术规模化部署,每一轮的目标都是把PUE压得更低。 但现在AIDC的服务模式开始从“卖卡时”转向“卖Token”。生意的计量单位变了,评价效率的标尺自然需要同步迭代。PUE更关注“用了多少电”,却回答不了“这些电产出了多少有效价值”,这正是当前AIDC行业正在共同面对的认知空白。 更深层的矛盾,来自旧效率标尺的局限性,PUE下降并不必然意味着总能耗或Token成本同步下降。林海举例说,调高送风温度可能降低制冷能耗,让PUE账面数据更好看,却会使GPU与服务器风扇功耗上升,最终总用电未必下降,Token产出成本甚至可能升高。 基于此,商汤大装置提出了一个全新的效率指标:TPW(Tokens Per Watt),以单位电力成本产生的有效Token作为核心指标,统一衡量算力效率、能源效率与业务价值。 简单来说,PUE衡量电力使用效率,TPW则进一步回答每一度电最终产生了多少有效Token,并将分时电价等因素纳入经济性评价,推动行业的关注重点从“用了多少电”,转向“这些电形成了多少有效产出”。 TPW并非对PUE的简单否定或替代,而是在PUE基础上,进一步打通从电力投入到Token产出的全链路效率评价。过去分散在各环节的优化动作,包括电价、储能、PUE、GPU利用率与模型效率,由此开始指向Token产出这同一个价值指标。 对行业而言,TPW的价值不止于一个新指标,更在于它建立了一套统一的价值语言。电网、IDC、算力平台、模型厂商,可以在同一个标尺衡量下进行结果优化,算电协同也变成了可度量、可复制、可商业化的系统能力。 商汤大装置给出的答案,并不是简单增加算力或扩容电力,而是通过算电协同Agent,对算力任务、能源供给和基础设施进行统一编排调度,充分释放分时电价、需量控制和需求响应中的时间价值,每一度电发挥更高效能。 传统IDC中,电力系统关注楼栋、机柜、服务器等物理设备,算力平台关注Job、Pod、Node等云原生任务,两套体系长期独立运行,难以回答两个关键问题:是谁在用电?这些负荷是否可以调度? 为此,商汤大装置构建了八级数据穿透体系,贯通任务、算力资源与物理用电之间的映射关系,将GPU利用率、任务功耗、机柜负荷、楼栋用电等数据统一到同一时间轴和观测体系中,实现每一度电与每一个算力任务的精准对应,为后续预测、调度和优化提供统一的数据底座。 商汤大装置智算中心运维总监张煦介绍到:“可以看到,在临港AIDC的监控大屏上,这种映射已经落地为实际运行能力,任务实时功耗、节点GPU利用率、机柜及楼层负荷、楼栋IT功率与进线侧用电数据,都被纳入同一条观测链路,实现了每一度电的去向和产出都可追溯。” 在线推理等实时业务必须即时响应,而训练、评测、批处理等任务则可能具有分钟、小时乃至跨日的调节空间。系统根据业务优先级和延迟容忍度,自动将部分可调度任务安排到低电价、低负荷或资源更充裕的时段运行,在保障服务质量的前提下,提升整体资源利用率。 这种优化并不会减少总用电量,而是通过优化时序把空闲资源和电能更充分地利用起来,让同样的容量、同样的电量,产出更多有效Token,从而带来TPW的提升。 商汤大装置进一步结合容量挖潜、储能调度和电网需求响应,实现算力与能源的动态协同。并通过负荷预测、容量优化和储能削峰等,充分释放既有基础设施的资源潜力,在不新增供电容量的前提下,让有限电力承载更多有效计算任务。 张煦提到:“实测数据显示,在既有供电条件下,IT有效承载能力可提升约60%。这一提升并非来自新增供电容量,而是通过系统级协同,让同样的MW容量可以承载更多有效计算,实现AI基础设施整体效率的持续提升。” 在今年7月10日上海市迎峰度夏电力需求响应中,商汤临港AIDC率先启动算电协同调度模式,实现午间常规用电负荷削减75%,可调负荷规模达23MW,通过非关键任务暂停、基础设施降耗、储能放电等算力电力协同措施,在两小时向电网释放了4.6万度削峰电量。 这意味着,AIDC与电网的关系正在发生改变。过去,智算中心更多是需要重点保障的刚性负荷;如今,当算力任务能够被识别、分级和智能调度后,负荷弹性便成为一种可运营、可调度的新型资产。算力任务可以根据业务优先级灵活安排执行时机,储能系统、算力资源与电网需求也能够协同联动,共同参与电网需求响应。 从PUE到TPW,AI基础设施优化的不再只是设备能效,而是整个算力系统的运行效率。商汤大装置所释放的,并非新增的算力或电力,而是隐藏在任务弹性、资源调度和能源协同中的系统效能。 源于商汤多年智算中心运营实践,商汤大装置打造了算电协同Agent,构建了一个会感知、能思考、可决策、可执行、持续进化的智能调度系统。不同于传统能源管理平台只关注电力侧,算电协同Agent能够同时连接算力、能源和业务,实现全链路协同优化,让每一度电持续创造更多Token。 在能力架构上,算电协同Agent依托八级数据穿透体系、五大智能决策链和六大运营能力,打通任务、算力、能源与基础设施之间的数据壁垒,形成从感知、预测、决策、执行到度量的完整闭环。系统不仅能够实现负荷预测、电价分析、储能优化、容量控制、暖通协同、算力调度等智能决策,更以TPW作为统一优化目标,将过去分散在不同系统中的优化动作统一到同一套效率体系中。 目前,算电协同Agent已全面应用于商汤临港AIDC,实现单位电力成本Token产出提升80%、平均电费单价低于同地区IDC约10%、算力负荷预测准确率达到96%。 商汤大装置智算中心运维总监张煦介绍到,为了让这一能力能够复制到更多智算中心,商汤大装置算电协同Agent采用平台化、模块化设计,将多年运营经验沉淀为可复用的Agent能力,并依托FDE(Field Domain Expert)专家体系形成标准化交付流程,新场景最快一周即可完成部署上线,实现算电协同能力快速复制。 对于国家算力枢纽节点、万卡级智算中心等大型AI基础设施,算电协同Agent能够统一调度算力、能源与储能资源,提升集群整体算效,优化绿电消纳和综合用能成本。 对于算力运营商、AI云服务商以及Token工厂,系统能够结合电价预测、负载优化与算力调度,实现单位Token电力成本持续下降,在保障业务SLA的同时提升资源利用率和运营收益。 对于企业级智算中心、科研机构以及行业AI平台,依托模块化架构和标准化交付体系,客户无需重构现有基础设施,即可快速部署算电协同能力,构建更加智能、高效、绿色的智算中心运营体系。 商汤大装置智算中心总经理林海认为,从PUE到TPW,变化的不只是评价指标,更是AI基础设施的运行方式。未来,算电协同将不再只是智算中心的节能手段,而是连接算力、能源与业务的核心能力。商汤大装置希望通过算电协同Agent,让系统优化能力实现标准化、产品化和规模化复制,推动AI基础设施进入系统级算效时代。

相关标签

免责声明:本文内容来自公开报道与编辑整理,仅供参考。转载请注明出处;版权争议请联系本站核实处理。页面地址:http://168jie.com/?m/detail/20260806-247.shtml

评论区

热门讨论 · 占位展示
说说你的看法…
发表评论
  • 用户
    读者6号
    首页结合季节和热点推问题,贴场景却不消费焦虑。语言通俗,但没有把科学讲成尴尬段子,分寸拿得住。标签过滤能躲开暂时太难的,先专注自己能消化的层级。有种被好好对待的感觉,而不是被算法拽着满世界乱跑。天文地理健康科技都有覆盖,单篇不长,信息密度却够用。后面会继续追专题,尤其是那些可迁移的硬核基础。
    20260817 · 来自移动端
  • 用户
    张瑞明
    长文进度能记住,地铁读到一半晚上接着看,同步很快。专题常把问题、证据和局限放在一起讲,读完更踏实。收藏、稍后读和笔记同步比较稳,复习旧内容不用重新翻半天。诚实在信息噪声里是稀缺品,一种可靠的说理方式很难被替代。和备考的人一起看时,讨论会自然落到证据而不是站队。
    2026-08-17 04:01:33
  • 用户
    热心网友
    偷拍 流浆 水,内容值得关注,期待后续更新。
    20260817

期待你的精彩发言。