匠人学院 JR Academy学AI来匠人
匠人学院 JR Academy学AI来匠人

Follow Us

linkedinfacebooktwitterinstagramweiboyoutubebilibilitiktokxigua

We Accept

/image/layout/pay-paypal.png/image/layout/pay-visa.png/image/layout/pay-master-card.png/image/layout/pay-airwallex.png/image/layout/pay-alipay.png
EN

关于公司

关于我们元宇宙课堂新闻资讯匠人工作成为导师匠人导师联系我们匠人商店J3.Club

匠人资源

工作内推匠人活动1对1私教行业白皮书线上学习平台面试中心分享面试经验Internship会员中心

AI 工具

AI 工具箱考证匠 Cert Master求职匠 Job Hunter牛小匠 UniMate AI

AI 学习方向

全部学习方向AI EngineerContext EngineeringVibe CodingPrompt MasterAI BuilderAI 产品经理Python 入门

AI 应用提效

AI 办公提效AI 数据分析AI 财务AI 内容创作AI 视觉创作前端开发Hermes AgentOpenClaw 本地智能体

大学资源

墨尔本大学昆士兰大学新南威尔士大学悉尼大学莫那什大学阿德莱德大学RMITQUTUTS

少儿 AI 教育

Airbotix 少儿 AI 编程澳洲家长实用资料库NAPLAN 成绩单怎么看My School 学校数据指南悉尼私校学费 2026少儿编程课程与训练营

移民服务

澳洲移民技术移民189/190/491雇主担保482/186/494投资移民188/888英国移民美国移民加拿大移民

企业合作

P3职业孵化器Enterprise (EN)企业培训实习合作招聘合作申请合作

求职代理

岗位代投职位监控LinkedIn代运营LinkedIn人脉代加了解P3项目

匠人支持

FAQsTerms & ConditionsPrivacy PolicyCancellation & Refund PolicySite map

Top Categories

Web全栈班DevOps项目班数据工程全栈班数据分析项目班编程入门班Business Analyst实习算法集训营

求职就业

BA和产品经理实习数据科学实习数据分析实习Marketing实习简历修改面试指导导师指导VIP

地址

Level 10b, 144 Edward Street, Brisbane CBD(Headquarter)
Level 2, 171 La Trobe St, Melbourne VIC 3000
四川省成都市武侯区桂溪街道天府大道中段500号D5东方希望天祥广场B座45A13号
Business Hub, 155 Waymouth St, Adelaide SA 5000

联系方式

hello@jiangren.com.au0421-672-555

Disclaimer

footer-disclaimerfooter-disclaimer

JR Academy acknowledges Traditional Owners of Country throughout Australia and recognises the continuing connection to lands, waters and communities. We pay our respect to Aboriginal and Torres Strait Islander cultures; and to Elders past and present. Aboriginal and Torres Strait Islander peoples should be aware that this website may contain images or names of people who have since passed away.

匠人学院网站上的所有内容,包括课程材料、徽标和匠人学院网站上提供的信息,均受澳大利亚政府知识产权法的保护。严禁未经授权使用、销售、分发、复制或修改。违规行为可能会导致法律诉讼。通过访问我们的网站,您同意尊重我们的知识产权。JR Academy Pty Ltd 保留所有权利,包括专利、商标和版权。任何侵权行为都将受到法律追究。查看用户协议

© 2017-2026 JR Academy Pty Ltd. All rights reserved.

ABN 26621887572

认证/其他/Databricks MLP
其他专业级🤖 AI/ML

Databricks Certified Machine Learning Professional (MLP)

Prepare for the Databricks Machine Learning Professional exam with 54+ practice questions covering MLflow, model deployment, feature engineering, and ML monitoring.

开始刷题查看学习路径
54
单次题量
54
题库总量
90m
考试时长
70/100
及格分

快速判断

54 题
适合方向ML engineers building scalable ML pipelines on Databricks、Data scientists deploying production models with MLflow
备考节奏4-6 周(有经验)
题库内容3 章 · 10 小时
学习信号0 人学习 · 0/5
✓
一句话定论 · 值得考

如果你所在公司已经在 Databricks 上跑 ML 管线,这张证是目前市面上唯一"真·考 MLOps 工程"的 Professional 级认证 — 考的不是算法,是 MLflow Registry、Feature Store、Model Serving、Lakehouse Monitoring 的实战细节。

这张认证到底考什么

先把考试形式、适合人群、备考时长和学习范围讲清楚,再决定要不要投入时间。

Databricks Certified Machine Learning Professional(MLP)是 Databricks 三张 ML 系列证书里的顶级(Practitioner → Associate → Professional),定位给"已经在 Databricks 平台上交付过生产级 ML 项目"的工程师。和 Associate 的最大区别:Associate 考 SparkML API 和基础 MLflow 用法,MLP 考的是把一个模型从实验跑到线上、再监控到下线的完整生命周期决策 — 你会遇到大量"给你一个场景,选最合适的 MLflow 模式/部署策略/监控方案"的题。

考试基本参数:$200 USD、在线监考(Kryterion Webassessor)、60 道题、120 分钟、通过分 70%、证书有效期 2 年(到期前可以做免费的 Recertification 续证,这点比 AWS Specialty 的重考 + 再交钱友好得多)。题型以单选和多选为主,没有 ordering 或 hands-on lab。

考纲 4 大领域权重:

  • Experimentation:30%(MLflow Tracking、parent/child run、autolog、Feature Store 写入与读取、Pandas API on Spark vs PySpark)
  • Model Lifecycle Management:30%(MLflow Model Registry 的 stages/aliases、webhook、Unity Catalog 下的三级命名空间模型、AB 实验流程、再训练触发)
  • Model Deployment:25%(Real-time Model Serving Endpoint、Batch Inference via Spark UDF、Pandas UDF、Streaming inference、AB/canary 流量切分、custom pyfunc 打包)
  • Solution and Data Monitoring:15%(Lakehouse Monitoring 的 Snapshot/TimeSeries/InferenceLog 三种 profile、drift metric、alert 与 retrain 联动)

一个经常被忽视的变化:Databricks 2024 年开始把 Model Registry 从 Workspace-scoped 迁移到 Unity Catalog-scoped(即 "Models in UC")。新考纲默认你在 UC 下用 "catalog.schema.model_name" 三段式命名 + aliases(Champion/Challenger)替代原来的 Stages(None/Staging/Production/Archived)。如果你看的还是 2023 年的老教程,很多题会答错 — 这是 MLP 最大的版本坑,考前必须确认自己学的是 UC 版本的 Registry。

跟 AWS MLA-C01、Azure AI-102 的定位差别:MLA 考 SageMaker 全家桶的用法(偏场景广度),AI-102 考 Azure AI 服务的集成(偏产品 API),MLP 考Databricks 一个平台内的 MLOps 深度 — 你要能说清楚 Feature Store 的 online lookup 为什么不能直接读 offline Delta 表、custom pyfunc model 为什么要重写 "predict()" 签名、Model Serving Endpoint 的 scale-to-zero 会给首次推理带来多少延迟。这张证没有水分,但覆盖面窄,只有 Databricks 工作场景下才值回票价。

你会反复碰到的核心服务

MLflow Experiment TrackingModel Registry & Lifecycle ManagementSparkML Pipeline DevelopmentFeature Store ImplementationDistributed Hyperparameter TuningModel Serving & DeploymentML Pipeline MonitoringData Drift Detection

学完以后你能带走什么

  • Pass the Databricks MLP certification exam with confidence
  • Master key concepts across all exam domains
  • Identify and strengthen weak areas before the exam

考试详情

考试代码
MLP
发证机构
其他认证机构
时长
90 分钟
题目数
54 题
及格分
70/100
有效期
3 年
题型
single-choice、multiple-choice
考试语言
English
官方页面
打开官方页面

适合谁考

适合人群

  • ML engineers building scalable ML pipelines on Databricks
  • Data scientists deploying production models with MLflow
  • AI platform engineers implementing MLOps best practices
  • Software engineers transitioning into machine learning roles

开始前最好先有

  • 1+ years of ML project experience on the Databricks platform
  • Proficiency in Python and ML libraries (scikit-learn, SparkML, XGBoost)
  • Working knowledge of MLflow for experiment tracking and model management
  • Understanding of feature engineering, model evaluation, and deployment concepts

值不值得考?职业价值

Databricks MLP 持证人的薪资区间、对应岗位、以及真实的职业影响。

澳洲
$155K-230KAUD
美国
$175K-285KUSD
中国
¥500K-950KCNY
新加坡
$130K-210KSGD
Senior Machine Learning EngineerMLOps EngineerML Platform EngineerDatabricks ML EngineerApplied ML EngineerLakehouse ML EngineerAI Platform EngineerStaff ML Engineer资深机器学习工程师MLOps 工程师

为什么 MLP 持证人的薪资处于 ML 岗位的上四分位

ML Engineer 本身就属于云岗位的 premium 档位,而带 Databricks + MLflow + Feature Store 技能栈的 Senior ML Engineer 又在 ML 岗位里处于上四分位。Levels.fyi 2026 Q1 数据显示,美国 Senior MLE 中位数 $205k,Staff MLE $265k;其中标注 "Databricks" 或 "MLflow" 的岗位中位数再加 $15-25k。原因不是这张证本身值钱,而是用 Databricks 跑生产 ML 的公司普遍是金融、医疗、零售大厂(Block、Comcast、Shell、HSBC、Rivian、Condé Nast、丰田),这些公司的 ML 预算和岗位级别都在 senior 以上。

各市场真实行情(2026 数据)

  • 澳洲:Sydney/Melbourne 的 Senior ML Engineer AUD 160-200k,带 Databricks 栈标签的 Staff 级 210-240k。NAB、Westpac、CBA、Coles、Woolworths、Telstra 是主要用 Databricks 的本地雇主;另外 Atlassian、Canva、Afterpay 部分团队也跑 Databricks。Canberra 政府项目(Services Australia、ATO 的数据平台)偶尔招 ML 岗位,有 clearance 加成 15-25%。
  • 美国:Senior MLE USD 180-250k,Staff/Principal 260-320k。湾区、纽约、西雅图溢价明显。Databricks 自己作为公司在 2026 年估值已超 $60B,他家的客户清单基本就是 MLP 持证人的主要去向。
  • 中国一线:北上深外资金融(高盛中国、汇丰、摩根士丹利)、跨境电商(Shein、Shopee 国际事业部)、新能源车(蔚来、理想、小鹏的智驾数据平台)是主要用户。RMB 50-95 万。纯国内互联网大厂(阿里、腾讯、字节)自研平台多,MLP 证书在国内认可度低于 Databricks Associate — 国内更看项目经验。
  • 新加坡:DBS、OCBC、UOB 的 AI/ML 团队在 2024-2025 大规模上 Databricks,SGD 135-195k 是主流区间,带 Staff title 能到 SGD 210k+。

真正值得考 MLP 的三类人

  1. 已经在 Databricks 客户公司做 ML 两年以上的工程师:你每天在用 MLflow 和 Feature Store,但没系统整理过知识。MLP 备考会逼你把 Model Serving Endpoint 的冷启动、Pandas UDF 的 batch size 调优、Lakehouse Monitoring 的 InferenceLog profile 这些平时只会用"默认参数"的东西搞清楚。考完在公司内部 MLOps 讨论里话语权会明显变强,内推时"Databricks MLP 认证"在 Databricks 合作伙伴公司(Deloitte、Accenture、Thoughtworks 这种咨询类)特别加分。
  2. 从 SageMaker/Vertex AI 转 Databricks 的 senior MLE:你已经懂 MLOps 理念(Model Registry、A/B、监控),只是换平台。MLP 是最快的"平台切换认证"— 大概 4-6 周就能过,不用从零学 ML 概念。
  3. 数据工程师转 ML 工程的中后期路径:先考 Databricks DEA(数据工程入门)→ 在项目里参与 ML 管线 → 考 Databricks ML Associate → 最后考 MLP。这条路径在 Databricks 重度客户的公司内部晋升通道里很标准。

不建议考的人

  • 纯研究型数据科学家:MLP 几乎不考算法细节(没有 SVM、梯度下降、loss function 推导),全是平台和工程问题 — 对你日常工作帮助有限。
  • 公司不用 Databricks 的 ML 工程师:Model Serving Endpoint、Lakehouse Monitoring、Feature Store 都是平台专属功能,学了用不上。你应该考 AWS MLA-C01 或 Azure AI-102。
  • 刚入行 < 1 年的 ML 新人:MLP 考生默认你懂 MLOps 的基本概念(shadow deployment、champion/challenger、drift 类型)。零经验直接上 MLP 很痛苦 — 应该先考 Databricks ML Associate 打底。
  • 打算一年内离开 Databricks 生态的人:证书 2 年有效,如果你半年后要转 Snowflake + dbt + Fivetran 栈,这 $200 打水漂。

备考节奏

有 AWS 实操经验

4-6 周

零基础切入

10-14 周

建议日投入

1.5-2 小时/天

学习路径预览

3 章
1
Databricks MLP Exam Overview
40 min
2
Databricks
108 min
3
Exam Preparation & Practice
100 min

分阶段备考路径

过来人总结的分阶段备考节奏,按周拆分,不是空话。

1

第一阶段:确认你学的是 Unity Catalog 版本(第 1 周)

在正式学习前先做一件事:登录你公司的 Databricks Workspace,检查是否启用 Unity Catalog。如果是,MLflow Registry 会显示三段式 `catalog.schema.model`;如果不是(老 Workspace),显示的是 Stages。两者考法完全不同。MLP 2025 年后的考纲以 UC 版本为准,所以如果你公司还是老 workspace,必须开一个 Databricks Free Trial(14 天 + $400 credit)启用 UC 专门练习。这一周的目标:在 UC 下建 catalog → 注册一个 sklearn 模型 → 设置 @champion/@challenger aliases → 用 `mlflow.set_registry_uri("databricks-uc")` 把客户端指向 UC。不做这一步直接刷题会被版本差异坑惨。

2

第二阶段:Databricks Academy Professional 路径(第 2-4 周)

customer-academy.databricks.com 上的 "Machine Learning Professional Learning Plan" 是备考主干材料,免费自学。重点过这几门:Scaling Machine Learning Pipelines、MLflow Model Registry with Unity Catalog、Automated Deployment with Databricks Asset Bundles、Monitoring Machine Learning Models。每门课都带 Notebook 实验 — 必须自己动手跑一遍,不要只看视频。尤其是 Feature Store 那节的 online table 创建实验 — 考试里至少有 3-5 题跟 online vs offline 读取路径相关,没亲手跑过一次根本记不住 `create_training_set` 和 `score_batch` 的参数差别。

3

第三阶段:四大难点攻坚(第 5-6 周)

这一阶段专门打 MLP 的 4 个送分/送命点:(1) **Custom pyfunc model 打包** — 什么时候要自定义 `PythonModel` 子类、`load_context` 和 `predict` 的调用顺序、如何在 model 里带 preprocessing 逻辑。(2) **Pandas UDF vs Spark UDF vs mapInPandas 的取舍** — batch inference 场景下哪个吞吐最高、哪个内存最稳、什么时候 iterator pattern 更合适。(3) **Lakehouse Monitoring 的三种 profile** — Snapshot 用于静态表、TimeSeries 用于有时间戳的 fact 表、InferenceLog 用于包含预测和 label 的推理日志表;考题会给你一个表结构让你选 profile 类型。(4) **Model Serving Endpoint 的 scale-to-zero 与 provisioned concurrency** — cold start 延迟、route traffic 的 canary 配置、AB 测试如何在一个 endpoint 上跑多个 model version。这四块搞透,考试基本稳过。

4

第四阶段:模考冲刺(第 7 周)

官方没有免费 Practice Exam(MLP 这张证点没有 Associate 级别那么体贴),要去 Databricks Academy 买 $99 的 Practice Assessment(60 题、与真题同源、最接近真实难度)— 这笔钱强烈建议花,MLP 第三方题库质量普遍很差,大量题目跟 Associate 混淆甚至考错版本。做 2 套全真模考,严格 120 分钟、关手机、不查资料。目标是连续 2 次 ≥ 80% 再约正式考。Databricks 在线监考规则严格:桌面不能有任何物品(包括水杯)、不能戴手表耳机、房间 360° 扫描、全程录像。提前 30 分钟 check-in 避免技术问题。

通过者的真实经验

过来人的备考时长、分数、以及踩过的坑。

我每天都在用 MLflow 和 Feature Store,以为 MLP 会很轻松,结果第一次模考才 61%。问题全在"平时只用默认参数"的细节上 — 比如 Model Serving Endpoint 的 workload size 和 concurrency 关系、custom pyfunc 的 `input_example` 为什么会影响 schema enforcement、UC 下 model alias 转移时 downstream job 怎么无缝切换。重点补了 Model Deployment 和 Lifecycle 两块,第三次模考 85% 才去正式考。考完最大的感受:MLP 不是"证明你会 ML",是"证明你懂 MLOps 的工程决策"— 题里没有算法推导,全是"给一个场景选最合适的实现方式"。

J. Liu84%
Senior ML Engineer(金融科技,Databricks 3 年) · 备考 5 周

有 2 年 SageMaker 经验,转岗后公司让我 8 周内考下 MLP。MLOps 概念是通的(Registry、Monitor、Canary 这些跨平台共通),难的是 Databricks 特有的实现 — 尤其是 Feature Store 的 online table(SageMaker Feature Store 的 online store 概念相近但 API 完全不同)、Lakehouse Monitoring 的 profile 类型(SageMaker Model Monitor 只分 data/model/bias/attribution 四种,Databricks 按表结构分 Snapshot/TimeSeries/InferenceLog 三种,思路不一样)。第 5 周才真正搞懂 InferenceLog profile 要求表里同时有 prediction 和 label 列、label 可以延迟写入、monitor 会自动重算历史 window。险过,但值回票价 — 转岗后的 Principal MLE title 就是靠这张证 + 项目经验拿下来的。

S. Nakamura79%
MLOps Engineer(从 AWS SageMaker 转 Databricks) · 备考 6 周

我们公司整套基础设施就是 Databricks + Unity Catalog + MLflow + Feature Store + Model Serving,每天训练 + 部署 20+ 个模型,我自己负责 Monitoring 和 retrain pipeline。考 MLP 主要是补考纲里我没用过的部分 — 比如 Databricks Asset Bundles(我们团队用 Terraform 管理 infra,从来没用过 DAB),还有 Pandas API on Spark 和 Pandas UDF 的区别(我们 batch inference 都用 mapInPandas)。4 周速成靠的就是"缺什么学什么",不按课程顺序走。最大的教训:不要轻视 Experimentation 这 30% 的权重 — 我以为 MLflow Tracking 我天天用闭着眼都能过,结果考题里 parent/child run 的嵌套 autolog 行为、artifact 路径、`mlflow.evaluate()` 的 built-in metrics 这些我答了一半不确定。建议所有人都刷一遍官方 MLflow 文档的 Tracking 章节,不要跳过。

初创 ML Platform Engineer91%
AI 初创公司 ML 平台工程师(Databricks on AWS + UC) · 备考 4 周

同赛道认证对比

Databricks MLPDatabricks DEAAWS ML Engineer Associate
机构其他其他AWS
级别专业级助理级助理级
考试费$0$0$150
时长90 min90 min170 min
单次考试题量546565
有效期3 年3 年3 年

备考技巧与常见失误

💡

**先确认你学的是 Unity Catalog 版本的 MLflow Registry**:这是 MLP 最大的版本坑。2024 年之后 Databricks 力推 "Models in UC",新考纲默认 UC 模型(aliases 替代 stages)。如果你的学习材料里还在讲 `transition_model_version_stage()` 和 Stages,那是 2023 年的老版本 — 必须换材料。最简单的验证方法:看是否出现 `mlflow.set_registry_uri("databricks-uc")` 和 `catalog.schema.model_name` 三段式命名。

💡

**官方 Databricks Academy 的 Professional 学习路径是唯一可靠主力**:第三方 MLP 课程质量普遍很差(Udemy、AZ-400 style 题库都不靠谱),官方 Academy 虽然视频节奏慢但考点覆盖准确。配合官方文档的 Feature Engineering、Model Serving、Lakehouse Monitoring 三个章节精读。

💡

**Databricks Academy 的 $99 Practice Assessment 值得买**:MLP 没有免费 practice exam,这套 60 题收费练习题是考前唯一可靠的真题模拟。别去找 ExamTopics 的 dump — MLP 这张证用的人不多,dump 质量参差且常常是 Associate 的题混进来。

💡

**Custom pyfunc model 必须手写一遍**:考试至少 3-5 题涉及 `mlflow.pyfunc.PythonModel` 的 `load_context` 和 `predict` 方法。备考时一定要自己写一个简单的 custom model(例如 sklearn model + preprocessing 逻辑),打包、注册到 UC、用 `load_model` 加载回来、验证 predict 行为。没亲手写过纯靠背概念必错。

💡

**Lakehouse Monitoring 的 3 种 profile 必须分清**:Snapshot(静态 baseline 表,没有时间戳)、TimeSeries(有 timestamp 列的时序数据)、InferenceLog(有 timestamp + prediction + label 的推理日志)。考题会给你一个表结构让你选 profile。口诀:"有 label 和 prediction 就是 InferenceLog,有 timestamp 无 prediction 就是 TimeSeries,都没有就是 Snapshot"。

💡

**考试时遇到"最优"选项要想成本 vs 延迟 vs 吞吐 vs 准确性的 trade-off**:MLP 大量题是"给一个场景选最合适方案",不是"选技术上正确的方案"。看到"成本最低" → 倾向 batch + scale-to-zero;看到"延迟最低" → 倾向 provisioned serving + online feature store;看到"吞吐最高" → 倾向 Pandas UDF 或 mapInPandas;看到"易于维护" → 倾向 Databricks Asset Bundles + CI/CD。别选技术最炫的,选场景最贴的。

💡

**在线监考细节**:桌面只能有电脑,手机要放到摄像头看不到的地方,不能戴手表耳机水杯都不行。房间 360° 扫描,背景要干净。监考员会随机要求你把手腕和耳朵再照一遍。网络用网线不用 WiFi。提前 30 分钟 check-in。考试中间不能上厕所(120 分钟一口气)— 考前 2 小时少喝水。

💡

**证书有效期 2 年,续证免费**:到期前会收到 Databricks 邮件,登录 Credentials 门户做 Recertification(25 题、在线、时间短),不用重新交 $200。这是 Databricks 系列证书相比 AWS Specialty 最大的性价比优势。

⚠️

**Feature Store 的 online table 和 offline table 混淆** — Offline Feature Store 就是 Delta 表(存在 UC 的 catalog.schema 下),用 `create_training_set()` 读取,走 batch 路径、延迟分钟级、支持时间点 join(point-in-time correctness)避免 label leakage。Online Feature Store 是同步出去的 key-value 存储(背后是 Databricks 管理的 online store 或者第三方如 DynamoDB、Cosmos DB),用 `lookup` API 读取、走 REST 路径、延迟毫秒级、用于 Model Serving Endpoint 的低延迟推理。考题常见陷阱:"需要在 Model Serving Endpoint 内部查询用户历史特征" — 答案一定是 online table + feature serving endpoint,不是直接读 Delta 表(Delta 表读取延迟根本无法满足实时推理)。

⚠️

**MLflow Model Registry Stages 和 UC Aliases 混用** — 老版本 Workspace Model Registry 用 Stages:None → Staging → Production → Archived,通过 `transition_model_version_stage()` 转换。新版本 Unity Catalog Model Registry 完全废弃 Stages,用 **aliases**(例如 `@champion`、`@challenger`、`@baseline`),通过 `set_registered_model_alias()` 设置,一个 model version 可以有多个 alias。考题会给一段代码让你判断哪个是 UC 版本、哪个是老版本。关键信号:`mlflow.set_registry_uri("databricks-uc")` + 三段式 `catalog.schema.model` 命名 = UC 版本;直接写 `model_name` + 出现 `stage="Production"` = 老版本。考试默认考 UC 版本。

⚠️

**Drift 类型搞错导致监控方案选错** — Lakehouse Monitoring 支持多种 drift metric:**feature drift**(输入分布变化,用 JS divergence、Wasserstein distance)、**prediction drift**(模型输出分布变化,可以在没有 label 时就能检测)、**label drift**(真实标签分布变化,需要 ground truth)、**model quality drift**(精度/召回率下降,需要 ground truth + predictions 都写入 InferenceLog 表)。考题场景:"label 延迟 7 天才能回填,但希望第一时间发现问题" — 答案是监控 prediction drift 或 feature drift,不是等 label 到了才监控 model quality。场景:"客服分类模型 label 永远拿不到" — 只能监控 feature/prediction drift。

⚠️

**AutoML 的限制认知错误** — Databricks AutoML 不是万能的:只支持 classification、regression、forecasting 三类问题;不支持 image、NLP(text embedding)、time series 的多变量场景;输入表必须是 Spark DataFrame 或 pandas DataFrame 且数据量有上限;生成的 notebook 是起点不是终点(需要人工优化 feature engineering)。考题陷阱:"用 AutoML 训练图像分类模型" — 错,AutoML 不支持图像。"AutoML 生成的 baseline 模型可以直接注册到生产" — 错,官方推荐用生成的 notebook 作为起点人工迭代。记住:AutoML = 快速 baseline + 生成可编辑 notebook,不是一键部署。

⚠️

**Spark ML Pipeline 和 scikit-learn 的分布式误解** — Spark ML(pyspark.ml)的 Estimator/Transformer 是**真正分布式**的,训练数据分布在多节点、训练算法是 Spark 原生实现(LogisticRegression、RandomForest、GBT)。scikit-learn 是**单机**的,即使在 Databricks 上跑也只用 driver 节点的内存和 CPU — 要加速 sklearn 只能用 `joblibspark` backend 并行 hyperparameter search,或者用 pandas UDF 做 per-group 训练。考题场景:"2TB 训练数据,选什么框架" — 必须 Spark ML(sklearn 根本装不下)。场景:"10GB 数据,想要 sklearn 的丰富算法" — 可以 sklearn on single-node cluster,或者用 `spark_sklearn` 做 CV 并行。场景:"用 Hyperopt 做分布式超参搜索 sklearn 模型" — 正确,Hyperopt + SparkTrials 会把 trials 分到 executors。

⚠️

**Batch inference 的 Pandas UDF vs Spark UDF 性能认知错** — 普通 Spark UDF(`@udf`)是按行调用 Python 函数、有序列化开销、每行都要过 JVM ↔ Python 边界,慢。Pandas UDF(`@pandas_udf`)是按批调用、用 Arrow 序列化、Python 端直接拿到 pandas Series/DataFrame、模型一次推理一批数据,快 10-100 倍。Iterator of Series pandas UDF 还能让你只加载一次模型(放在 UDF 外部 closure),避免每个 batch 重新 load。考题:"最优的 batch inference 实现" — 答案几乎总是 Iterator pandas UDF 或 `mapInPandas`。普通 UDF 是典型错误答案。

⚠️

**Model Serving Endpoint 的 scale-to-zero 延迟被忽略** — Databricks Model Serving 支持 scale-to-zero(空闲时缩到 0 节省成本),但首次请求的 cold start 延迟是 **30-60 秒**(加载模型 + 启动容器)。这在实时推理场景下可能是灾难。考题场景:"用户面向的推荐接口,要求 p99 < 500ms" — 不能 scale-to-zero,必须 provisioned concurrency。场景:"内部日志分类 batch job,每天跑一次" — scale-to-zero 可以省钱。另一个陷阱:一个 endpoint 可以 host 多个 model version 并配置 traffic split 做 A/B(`served_models` + `traffic_config`),不需要开两个 endpoint。

常见问题

如果你准备考 Databricks MLP,先从真题型练习开始。

54 道练习题、章节学习路径、模考、错题复盘和 AI 导师都在备考页里。

进入备考页

$39 起 · 前 2 章可免费试学

学员评价

评价加载中…

你可能顺手也会看这些

Databricks DEA

其他 · 助理级
$065 题90 min

AWS ML Engineer Associate

AWS · 助理级
$15065 题170 min

Azure AI Engineer

Azure · 助理级
$16550 题100 min
备考题库

Databricks MLP 刷题通关

章节学习 + 模拟考试 + AI 导师,一站搞定

54
练习题
3
章节
10h
学习时长
AI
智能导师
  • 前 2 章免费试学
  • 真实考试格式模拟考
  • AI 错题智能复盘
  • 章节进度追踪
$39 起
立即开始刷题

备考快照

学习章节3
练习题54
预计学习时长10h

你会拿到什么

  • 54+ practice questions with detailed explanations
  • Mock exams simulating real test conditions
  • AI-powered tutoring for personalized study
  • Progress tracking and weak area identification