第 2 章

规划和管理 Azure AI 方案

⏱️ 180 分钟📚 Plan and manage an Azure AI solution难度: ⭐⭐
📝 25 题练习
备考助手

📋 本章概览

信息详情
考试领域Plan and manage an Azure AI solution
考试权重25%
建议时长180 分钟
难度⭐⭐ 中等
前置知识完成第 1 章 Azure AI 概述

📢 为什么这章重要:25% 的考试权重意味着大约 12-13 道题来自这个领域。而且这些知识不只是考试考——在企业里部署 AI 方案,"选对服务、配好安全、控好成本"比写代码更重要。


🎯 学习目标

完成本章后,你将能够:

  • ✅ 根据业务需求选择正确的 Azure AI 服务和定价层
  • ✅ 配置 Azure AI 资源的网络安全(VNET、Private Endpoint)
  • ✅ 使用 Entra ID 和 RBAC 管理 AI 服务的访问权限
  • ✅ 配置诊断日志和监控指标
  • ✅ 理解 Responsible AI 原则并在方案中落地
  • ✅ 规划 AI 方案的容量、成本和区域部署

知识地图

规划和管理 Azure AI 方案
│
├── 服务选型 ────────── 选对工具比写对代码更重要
│   ├── 预建 vs 自定义模型
│   ├── 定价层选择 (Free / Standard / Enterprise)
│   └── 区域可用性和延迟考量
│
├── 安全与合规 ──────── AI 工程师的"安全底线"
│   ├── 认证:API Key vs Entra ID (RBAC)
│   ├── 网络:VNET 集成 + Private Endpoint
│   ├── 数据加密:传输中 (TLS) + 静态 (CMK)
│   └── Key Vault 管理密钥
│
├── 部署与容器 ──────── 边缘和离线场景
│   ├── 容器化部署(Docker)
│   └── 断线环境(Disconnected containers)
│
├── 监控与诊断 ──────── 上线后才是开始
│   ├── Azure Monitor + Diagnostic Settings
│   ├── Log Analytics 查询
│   └── 告警规则配置
│
└── Responsible AI ──── 微软的 AI 价值观
    ├── 六大原则
    ├── Content Safety 实施
    └── 透明度和问责

🔧 服务选型:选对工具是第一步

预建模型 vs 自定义模型

拿到一个 AI 需求时,你面临的第一个决策就是:用现成的还是自己训练?

维度预建模型 (Pre-built)自定义模型 (Custom)一句话记忆
开发时间几分钟(调 API 就行)几天到几周(需要标注数据+训练)快 vs 慢
数据需求不需要自己的数据需要标注好的训练数据零数据 vs 要数据
精度通用场景够用特定场景更准80 分通用 vs 95 分专精
成本按 API 调用付费训练 + 推理双重成本用多少付多少 vs 先投资后使用
适用情感分析、OCR、翻译产品缺陷检测、行业文档分类常见任务 vs 专业任务

⚠️ 考试技巧:题目如果说"快速上线""无需额外数据""通用需求"——选预建。说"特定行业""自有数据集""高精度要求"——选自定义。

定价层对照

术语:SKU / Pricing Tier(定价层)

  • 一句话解释:Azure 服务的"套餐等级",不同等级有不同的调用限额、功能和价格。
  • 形象比喻:手机套餐——Free 是免费套餐(每月 5000 次调用,够你试用),Standard 是正式套餐(不限量但按量付费),Enterprise 是 VIP 套餐(有 SLA 保障和高级功能)。
  • 考试怎么考:"客户需要每秒处理 100 个请求,应该选什么定价层?"——Free 上限是 20 TPS,必须选 Standard 或更高。
  • 最易混淆:Free tier 在功能上可能有限制(比如不支持 Custom Neural Voice),不只是调用量的区别。
定价层TPS 限制适用场景注意事项
Free (F0)20 TPS开发测试、PoC功能可能不全,有月调用上限
Standard (S0)可提升生产工作负载按量付费,支持 SLA
Enterprise高 TPS大规模企业应用专属资源,高级安全

区域选择策略

不是所有 Azure AI 服务在每个区域都可用。选区域时考虑这几点:

  1. 服务可用性:Azure OpenAI 目前只在特定区域可用(如 East US、West Europe、Japan East)
  2. 数据驻留:有些行业要求数据不能出国(如 GDPR 要求数据留在欧洲)
  3. 延迟:离用户越近,响应越快
  4. 配对区域:Azure 的灾备会用配对区域——了解你的主区域配对是谁

⚠️ 考试陷阱:如果题目说"客户在澳大利亚,需要使用 Azure OpenAI"——你得检查 Australia East 是否支持 OpenAI。不支持的话就得选最近的可用区域(如 Japan East),而不是硬选本地区域。


🔒 安全与合规

Azure AI service monitoring view for operational diagnostics and health checks

这张图对应“管理”考点:方案上线后不仅要能跑,还要可观测、可审计、可告警。

认证方式对比

这是考试高频考点——Azure AI 服务有两种认证方式,企业场景几乎一定要用 Entra ID。

Managed identity role assignment for secure access to Azure AI resources

这张图对应 RBAC 授权配置,考试里凡是“最安全访问方式”通常都要落到 Managed Identity + 角色分配。

API Key 认证(简单但不安全)
─────────────────────────
客户端 → Header: Ocp-Apim-Subscription-Key: <key> → Azure AI Service
         ↑
         密钥写死在代码里或环境变量里
         任何拿到 key 的人都能调用
         没有细粒度权限控制


Entra ID 认证(安全、推荐)
─────────────────────────
客户端 → Entra ID → 获取 Token → Azure AI Service
         ↑                        ↑
         用 Managed Identity      RBAC 控制谁能做什么
         不需要管理密钥            支持条件访问
         可审计每次调用            最小权限原则

术语:Managed Identity(托管标识)

  • 一句话解释:Azure 自动帮你的应用创建和管理的身份凭证,你不需要在代码里写任何密码或密钥。
  • 形象比喻:公司给你配的工牌——你不用自己做工牌,公司发给你,凭工牌进各个房间,离职时公司自动注销。
  • 考试怎么考:"Web App 需要安全地访问 Azure AI Services,不在代码中存储凭证"——答案是 System-assigned Managed Identity + RBAC 角色赋值。
  • 最易混淆:System-assigned(跟资源绑定,资源删则身份删)vs User-assigned(独立存在,可以绑多个资源)。

网络安全

术语:Private Endpoint(私有终结点)

  • 一句话解释:让你的 Azure AI 服务只能通过你自己的虚拟网络访问,而不是通过公网。
  • 形象比喻:给 AI 服务装一个"内线电话"——只有公司内网的人能拨打,外面的人连号码都看不到。
  • 考试怎么考:"确保 AI 服务流量不经过公网"——Private Endpoint。"限制特定子网访问"——VNET Service Endpoint 或 Private Endpoint。
  • 最易混淆:Service Endpoint 只是改变路由路径(流量走 Azure 骨干网),但服务仍有公网 IP。Private Endpoint 是真正的私有 IP,服务彻底"隐身"。

Azure OpenAI network baseline architecture for secure service exposure and access control

这张图用于理解“默认网络边界”考点:哪些流量路径仍可能经过公网,哪些控制点可以收紧访问。 Azure OpenAI private endpoint architecture for isolating model traffic inside virtual network

这张图用于记忆 Private Endpoint 落地方式:考试题干出现“仅内网访问/禁止公网暴露”时优先匹配这类架构。

网络方案安全级别流量路径适用场景一句话记忆
公网访问走公网开发测试"谁都能来敲门"
防火墙规则走公网,白名单过滤已知 IP 范围"只开门给认识的人"
Service Endpoint中高走 Azure 骨干网同 VNET 内服务"走公司内部通道"
Private Endpoint私有 IP,完全不走公网生产/合规要求"装了内线电话"

Key Vault 密钥管理

即使你用 API Key,也不能把 key 写死在代码里。正确做法是放在 Key Vault 里。

# ❌ 错误做法:密钥硬编码
client = TextAnalyticsClient(
    endpoint="https://myai.cognitiveservices.azure.com",
    credential=AzureKeyCredential("abc123...")  # 密钥暴露在代码中!
)

# ✅ 正确做法 1:Managed Identity(最佳)
from azure.identity import DefaultAzureCredential
client = TextAnalyticsClient(
    endpoint="https://myai.cognitiveservices.azure.com",
    credential=DefaultAzureCredential()  # 自动使用 Managed Identity
)

# ✅ 正确做法 2:Key Vault(次优)
from azure.keyvault.secrets import SecretClient
secret_client = SecretClient(vault_url="https://myvault.vault.azure.net",
                              credential=DefaultAzureCredential())
key = secret_client.get_secret("ai-service-key").value

⚠️ 考试优先级:Managed Identity > Key Vault + API Key > 环境变量 API Key > 硬编码 API Key。题目问"最安全的方式",永远选 Managed Identity。


📦 容器化部署

Azure AI container endpoint overview for local and edge deployment patterns

这张图对应容器化落地场景:离线或边缘部署时,客户端通过本地容器端点访问模型能力。

为什么要把 AI 服务装进容器?

有些场景下你不能或不想把数据发到 Azure 云端:

  • 数据合规:医疗/金融数据不能出内网
  • 网络限制:工厂、船舶等断网环境
  • 延迟要求:实时推理需要毫秒级响应

Azure AI Services 支持把部分服务打包成 Docker 容器,部署在本地或边缘设备上。

术语:Disconnected Container(断线容器)

  • 一句话解释:可以在完全没有网络的环境下运行的 Azure AI 容器。
  • 形象比喻:把外卖厨师请到家里做饭——平时你去餐厅(云端),但特殊情况下厨师上门(本地容器),做出来的菜一样。
  • 考试怎么考:"在没有互联网的工厂环境中使用 OCR"——选 Disconnected Container。注意:需要定期联网上报使用量(计费要求)。
  • 最易混淆:普通容器需要保持网络连接;Disconnected Container 才是真正的离线模式,但需要提前申请。
容器化部署架构
──────────────────────────────────
│  本地/边缘环境                  │
│  ┌────────────────────────┐    │
│  │ Docker Container       │    │
│  │ ┌──────────────────┐   │    │
│  │ │ Azure AI Model    │   │    │
│  │ │ (Vision/Language/│   │    │
│  │ │  Speech)          │   │    │
│  │ └──────────────────┘   │    │
│  │        ↑ ↓             │    │
│  │    REST API 端点        │    │
│  │    localhost:5000       │    │
│  └────────────────────────┘    │
│           ↕ 定期连网上报计费    │
──────────────────────────────────
            ↕
    Azure(许可验证 + 计费)

支持容器化的服务

服务容器支持断线支持常见场景
Language (Text Analytics)本地文档分析
Vision (OCR/Read)工厂产线文字识别
Speech-to-Text离线语音转写
Translator需要连网
Face API需要连网
Azure OpenAI仅云端,不支持容器

⚠️ 考试重点:Azure OpenAI 不支持容器化部署。如果题目要求"在本地运行 GPT 模型"——答案不是 Azure OpenAI 容器,而是考虑其他开源模型或 Azure AI on Edge 方案。


📊 监控与诊断

上线后的"体检系统"

部署完 AI 服务不是终点——你需要持续监控它的健康状态。

术语:Diagnostic Settings(诊断设置)

  • 一句话解释:告诉 Azure "我想收集哪些日志和指标,发送到哪里去"。
  • 形象比喻:给 AI 服务装了行车记录仪+油量表——记录仪记下每次调用(日志),油量表显示实时状态(指标)。
  • 考试怎么考:"需要分析过去 7 天 AI 服务的调用模式"——启用 Diagnostic Settings → 发送到 Log Analytics Workspace → 用 KQL 查询。
监控架构
──────────────────────────────────────────
Azure AI Service
    │
    ├── Metrics(指标)─── Azure Monitor
    │   ├── Total Calls(调用总数)
    │   ├── Latency(延迟)
    │   ├── Successful Calls(成功数)
    │   └── Errors(错误数)
    │
    ├── Logs(日志)───── Log Analytics
    │   ├── Request logs(每次 API 调用详情)
    │   ├── Audit logs(配置变更记录)
    │   └── Trace logs(诊断追踪)
    │
    └── Alerts(告警)─── Action Group
        ├── 邮件通知
        ├── SMS
        ├── Webhook
        └── Azure Function 触发

常用 KQL 查询示例

// 查看过去 24 小时的错误请求
AzureDiagnostics
| where ResourceType == "COGNITIVESERVICES"
| where ResultType != "Success"
| where TimeGenerated > ago(24h)
| summarize ErrorCount = count() by ResultType, OperationName
| order by ErrorCount desc

// 分析 API 调用延迟分布
AzureDiagnostics
| where ResourceType == "COGNITIVESERVICES"
| where TimeGenerated > ago(7d)
| summarize avg(DurationMs), percentile(DurationMs, 95) by bin(TimeGenerated, 1h)

💡 备考建议:不需要背 KQL 语法,但要能看懂查询意图。考试可能给你一段 KQL,问你"这个查询在做什么"或"怎么修改才能满足需求"。


🤝 Responsible AI(负责任的 AI)

微软的六大 AI 原则

这不是空话——考试真的会考,而且是微软的价值观题,答案方向很明确。

原则含义考试应用场景一句话记忆
Fairness 公平性不因种族、性别等产生偏见模型训练数据要多样化"一碗水端平"
Reliability 可靠性在各种条件下稳定工作测试边界情况和错误处理"不能只在理想条件下好用"
Privacy 隐私保护用户数据数据加密、最小化收集"用户的数据不是你的"
Inclusiveness 包容性让所有人都能使用无障碍设计、多语言支持"不能只服务一部分人"
Transparency 透明度用户知道在和 AI 交互AI 输出带来源标注"告诉用户这是 AI 说的"
Accountability 问责制有人为 AI 行为负责建立审查流程和反馈通道"出了问题找得到人"

⚠️ 考试重点:Responsible AI 题目的答案一般倾向于"更安全、更透明、更公平"的选项。如果两个选项技术上都可行,选更符合 Responsible AI 原则的那个。

Content Safety 实施

Azure AI Content Safety 是 Responsible AI 在实操层面的落地工具。

Content Safety encryption architecture for protecting moderation data at rest and in transit

这张图强调“隐私与合规”考点:内容审核数据的加密链路,是企业审计场景常见要求。 Content Safety monitoring dashboard for incident trends and moderation effectiveness tracking

这张图强调“持续治理”考点:不仅要做审核,还要看告警趋势与命中分布来调整阈值策略。

Content Safety 工作流
─────────────────────────────
用户输入
    │
    ↓
Azure AI Content Safety
    ├── 暴力 (Violence) ──── 0-6 严重度评分
    ├── 仇恨 (Hate) ─────── 0-6 严重度评分
    ├── 色情 (Sexual) ────── 0-6 严重度评分
    └── 自残 (Self-harm) ── 0-6 严重度评分
    │
    ↓
    严重度 > 阈值?
    ├── 是 → 拦截,返回安全提示
    └── 否 → 放行,继续处理

💡 实用技巧:Content Safety 的阈值可以调节。业务场景不同,阈值也不同——医疗系统讨论"自残"是正常的,社交平台则需要更严格的过滤。


💰 成本管理

AI 服务计费模型

计费方式说明适用服务一句话记忆
按 API 调用每次调用收费Vision, Language, Speech"用一次付一次"
按 Token输入+输出 token 数计费Azure OpenAI"字越多越贵"
按页/图处理的文档页数或图片数Document Intelligence"看多少页收多少钱"
按数据量索引数据量 + 查询次数Azure AI Search"存多少、查多少"

成本优化策略

  1. 用 Free tier 做开发测试——别用 Standard 跑 PoC
  2. 缓存重复请求——同样的图片/文本不要重复调 API
  3. 选对模型大小——GPT-4o-mini 比 GPT-4o 便宜 10 倍,简单任务够用
  4. 设置预算告警——Azure Cost Management 里配一个月度预算上限

📝 本章小结

考点关键知识出题频率
认证方式Entra ID + RBAC > API Key⭐⭐⭐⭐⭐
网络安全Private Endpoint vs Service Endpoint⭐⭐⭐⭐
容器化哪些服务支持容器/断线⭐⭐⭐⭐
服务选型预建 vs 自定义、定价层选择⭐⭐⭐⭐
Responsible AI六大原则 + Content Safety⭐⭐⭐
监控Diagnostic Settings + KQL⭐⭐⭐
密钥管理Managed Identity > Key Vault > 硬编码⭐⭐⭐⭐⭐

🔗 参考资源

📝 章节练习 (25 题)
开始练习