核心变化:让 AI 成为可运营的基础设施
Red Hat 于 2026 年 9 月 11 日宣布 Red Hat AI 3.5 正式可用。这次更新的重点,并非单纯让企业更快部署模型,而是将模型、检索增强生成(RAG)流程和 AI 智能体纳入一套可治理、可观测、可供多团队共享的混合云生产运营体系。其目标是解决许多企业面对的关键断层:数据科学团队能够完成概念验证,却难以将其稳定、合规且经济地运行在生产环境中。
17
上线前先验证:模型选择与安全评测
AI 3.5 中,EvalHub 已达到正式可用状态。它可对企业自建或定制的模型、RAG 配置及智能体进行自动化、以风险为重点的安全基准测试,并生成可审计的合规报告。团队可在部署前评估提示注入、越狱等风险,而不是等服务上线后才被动处置。
17
与此同时,Red Hat 扩充了已验证模型目录,新增 20 多个模型,覆盖 Google、NVIDIA 和阿里云等提供方,并附带安全性、个人身份信息(PII)泄露及毒性风险等信息。对平台团队而言,这意味着模型选型可以更多依据可比较的评测证据,而非由每个业务团队各自建立一套验证流程。
17
GPU 不再“谁先抢到谁用”:面向多团队的资源控制
GPU 成本高、供给紧张,往往是 AI 从试点走向规模化时最直接的瓶颈。AI 3.5 引入或强化了公平份额调度、优先级感知服务、准入控制和基于优先级的请求路由,意在避免单个工作负载或团队长期占满 GPU 资源。
17
结合按用户的 Token 计量,企业可按团队进行成本归集或内部展示计费(showback),并把有限算力优先分配给更关键的服务等级需求。新增可观测性仪表板则用于查看推理服务健康度、GPU 利用率和模型性能信号,帮助运维人员在服务运行期间发现容量、可用性或输出质量问题。
17
RAG 与多语言数据:面向真实企业知识库
对于需要连接内部文档和知识库的应用,AutoRAG 增加了多语言能力,可为非英语及混合语言文档语料寻找合适的 RAG 模式。功能包括语言识别、实验配置、适用于中文等 CJK 文字的语言感知分块策略,以及将多语言嵌入模型纳入优化搜索空间。
4
这使企业能够更系统地处理跨语言知识检索场景。Red Hat 同时提供 AI Hub 模板,作为代码审查、文档处理和研究工作流等应用的起步架构。
17
混合云推理与 NVIDIA 的角色
在推理层,Red Hat AI Inference 3.5 提供面向大语言模型的优化容器镜像,支持 NVIDIA CUDA、AMD ROCm、Google TPU、Intel Gaudi 与 IBM Spyre 等加速器,也支持 IBM Z(s390x)和 IBM Power(ppc64le)等多架构环境。
3
分布式推理组件 llm-d 可部署在 Azure Kubernetes Service(AKS)和 CoreWeave Kubernetes Service(CKS)上;相关部署需要满足 Kubernetes 版本、GPU 节点和镜像仓库访问等前提条件。
5
6 Amazon Elastic Kubernetes Service(EKS)的推理感知调度仍是技术预览,不受 Red Hat 生产服务级别协议支持,官方也不建议将其用于生产环境。
8
在 Red Hat AI Factory with NVIDIA 的组合中,NVIDIA 加速基础设施与 Red Hat 的 Kubernetes 导向运营能力形成标准化层:企业可以在同一方法下验证模型、按规则分配 GPU 容量、监控推理服务,并跨混合基础设施部署。换言之,Red Hat 试图把实验阶段常见的“模型能跑”升级为生产阶段所需的“模型能被信任、管理和持续运营”。
17
3
企业该如何理解这次发布
Red Hat AI 3.5 的价值主要在于把几项原本分散的生产能力串联起来:
- 部署前有证据:通过模型评测与风险报告支持治理和选型;
- 运行中有秩序:通过调度、优先级和计量控制共享 GPU;
- 出问题能看见:以推理、算力和模型信号支撑持续运维;
- 跨环境可复制:基于 Kubernetes 在不同加速器和部分托管云平台上部署推理服务。
需要注意的是,“正式可用”并不意味着所有相关功能都已全面进入生产支持范围:Azure 和 CoreWeave 的 llm-d 部署路径属于支持范围,而 Amazon EKS 的推理感知调度明确仍为技术预览。
8