资讯概览

Microsoft 与 AT&T 介绍在 Microsoft Foundry 和 AMD 基础设施上扩展万亿Token级 AI 工作负载的案例。大型电信企业同时拥有客服、网络运营、开发和内部知识等多种场景,请求规模与峰值差异很大,单纯增加GPU并不能保证稳定。平台需要在模型服务、硬件调度、吞吐、延迟、故障恢复和成本观察之间形成完整体系。该案例也说明企业AI基础设施正在从单一硬件路线转向可在不同加速器上运行的选择。

技术细节

万亿Token是累计处理规模,并不等于一次请求拥有超长上下文。生产系统更关心每秒处理量、首Token延迟、批处理效率、模型并发和服务等级。AMD加速器与Foundry平台组合需要匹配模型精度、内存、网络和软件栈,同时通过遥测观察热点与失败。企业数据还必须经过身份、权限和内容安全控制,避免高吞吐扩大错误或泄露。官方案例提供架构与成果方向,但具体成本和性能受模型、区域及工作负载影响。

行业影响

硬件供应多样化有助于缓解单一GPU供应与价格压力,也推动云平台提供更统一的模型部署接口。对于企业采购,比较芯片峰值算力远远不够,迁移成本、软件兼容、运维能力和实际Token吞吐更关键。规模越大,1%的效率差异都会转化为显著费用,因此模型量化、批处理、缓存和路由将与硬件选择同等重要。

阅读与使用建议

企业规划类似项目时,应先用真实提示长度和并发分布做基准测试,分别测量平均、峰值与故障场景。合同中明确服务等级、数据位置和容量保障,并避免把供应商案例数字直接当成本公司预期。采用多硬件前要验证模型输出一致性、监控工具和团队技能。还应设置单位成功任务成本和质量指标,防止为了吞吐牺牲答案可靠性。本文依据 Microsoft Azure 官方案例整理。