AI News

Azure扩展AMD AI算力:企业部署大模型为什么需要异构架构

微软Azure扩展AMD AI与HPC基础设施。本文解释训练、推理、数据系统的硬件分工,以及企业如何从性能、成本和迁移风险做选型。

Azure扩展AMD AI算力:企业部署大模型为什么需要异构架构

微软在2026年7月20日宣布扩大Azure与AMD在AI和高性能计算领域的合作,针对AI数据系统、科学计算和生产级推理提供不同硬件组合。背后的趋势是,大模型工作负载已经无法依赖一种芯片解决所有问题。训练、推理、向量检索、数据预处理和Agent工具执行对计算、显存、带宽和延迟的要求并不相同,异构架构正在成为云端常态。

为什么一种GPU不够用

大规模训练需要高带宽互联和稳定的集群通信;在线推理强调低延迟、并发和每Token成本;数据预处理可能更依赖CPU与内存;向量数据库关注存储和网络。把所有任务放在最贵加速器上会造成浪费,把复杂模型放在低配实例上又会增加排队和失败。

先给工作负载分类

企业应把任务分为离线训练、批量推理、实时交互和后台Agent。记录模型大小、上下文长度、峰值并发、延迟目标、数据规模和可接受成本。批量摘要可以等待更久并集中执行,客服需要快速首Token,科研模拟则可能连续运行数小时。分类后才能选实例,而不是只看厂商宣传。

性能测试要用自己的数据

公开基准无法代表中文长文、企业知识库和工具调用。准备真实请求,测首Token延迟、输出速度、吞吐、显存占用、缓存命中和每个成功任务成本。还要测试高峰、长上下文和模型冷启动。相同芯片在不同框架、量化方式和批处理设置下可能差异很大。

异构带来的软件挑战

不同加速器需要不同驱动、内核和监控工具,迁移可能遇到算子不支持或数值差异。模型服务应容器化,硬件相关配置与业务代码分离;建立统一请求层和可移植模型格式;关键模型保留至少一种替代部署方案。上线前运行一致性测试,确认输出质量没有因量化或内核变化下降。

成本不能只看实例单价

总成本包括利用率、网络传输、存储、空闲时间、运维和故障恢复。一台单价更低但利用率差的机器未必划算。可以让在线服务保留稳定容量,把可延迟任务调度到价格更低的时段或实例;使用自动扩缩容时设置上限,防止突发请求导致预算失控。

数据与合规边界

跨区域调度可能改变数据所在位置。企业要确认模型、缓存、日志和备份的区域,敏感数据尽量就近处理。硬件供应商变化不应绕过访问控制和审计。训练数据、推理请求与运维日志分开授权,删除与保留策略也要一致。

中小企业的务实路线

没有必要一开始自建复杂集群。先使用托管API验证场景,再对调用稳定、数据敏感或成本高的任务评估专属部署。选择两到三个代表模型进行小规模压测,只有达到明确节省目标才迁移。硬件是手段,业务任务成功率和用户体验才是结果。

未来趋势

随着模型种类和Agent任务增加,云平台会更像智能调度市场:根据质量、延迟、价格和数据位置动态选择硬件与模型。企业真正需要积累的是评测、路由和可移植能力,而不是押注某一款芯片。异构架构的价值,在于让每类工作使用最合适的资源。

资料来源:Microsoft:Azure AI and HPC infrastructure with AMD

Next Reading

继续深入这个主题

从专题、教程和热门关键词继续阅读,帮助搜索引擎和读者理解文章之间的关系。

ChatGPT / GPT Claude Gemini DeepSeek AI Agent 大模型 AI赚钱 开发者