微软在2026年7月20日宣布扩大Azure与AMD在AI和高性能计算领域的合作,针对AI数据系统、科学计算和生产级推理提供不同硬件组合。背后的趋势是,大模型工作负载已经无法依赖一种芯片解决所有问题。训练、推理、向量检索、数据预处理和Agent工具执行对计算、显存、带宽和延迟的要求并不相同,异构架构正在成为云端常态。
为什么一种GPU不够用
大规模训练需要高带宽互联和稳定的集群通信;在线推理强调低延迟、并发和每Token成本;数据预处理可能更依赖CPU与内存;向量数据库关注存储和网络。把所有任务放在最贵加速器上会造成浪费,把复杂模型放在低配实例上又会增加排队和失败。
先给工作负载分类
企业应把任务分为离线训练、批量推理、实时交互和后台Agent。记录模型大小、上下文长度、峰值并发、延迟目标、数据规模和可接受成本。批量摘要可以等待更久并集中执行,客服需要快速首Token,科研模拟则可能连续运行数小时。分类后才能选实例,而不是只看厂商宣传。
性能测试要用自己的数据
公开基准无法代表中文长文、企业知识库和工具调用。准备真实请求,测首Token延迟、输出速度、吞吐、显存占用、缓存命中和每个成功任务成本。还要测试高峰、长上下文和模型冷启动。相同芯片在不同框架、量化方式和批处理设置下可能差异很大。
异构带来的软件挑战
不同加速器需要不同驱动、内核和监控工具,迁移可能遇到算子不支持或数值差异。模型服务应容器化,硬件相关配置与业务代码分离;建立统一请求层和可移植模型格式;关键模型保留至少一种替代部署方案。上线前运行一致性测试,确认输出质量没有因量化或内核变化下降。
成本不能只看实例单价
总成本包括利用率、网络传输、存储、空闲时间、运维和故障恢复。一台单价更低但利用率差的机器未必划算。可以让在线服务保留稳定容量,把可延迟任务调度到价格更低的时段或实例;使用自动扩缩容时设置上限,防止突发请求导致预算失控。
数据与合规边界
跨区域调度可能改变数据所在位置。企业要确认模型、缓存、日志和备份的区域,敏感数据尽量就近处理。硬件供应商变化不应绕过访问控制和审计。训练数据、推理请求与运维日志分开授权,删除与保留策略也要一致。
中小企业的务实路线
没有必要一开始自建复杂集群。先使用托管API验证场景,再对调用稳定、数据敏感或成本高的任务评估专属部署。选择两到三个代表模型进行小规模压测,只有达到明确节省目标才迁移。硬件是手段,业务任务成功率和用户体验才是结果。
未来趋势
随着模型种类和Agent任务增加,云平台会更像智能调度市场:根据质量、延迟、价格和数据位置动态选择硬件与模型。企业真正需要积累的是评测、路由和可移植能力,而不是押注某一款芯片。异构架构的价值,在于让每类工作使用最合适的资源。