テーマ切替
Databricks Data Engineer Professional 取得ロードマップ
Databricks 認定データエンジニア プロフェッショナル(Professional)合格までの学習ロードマップです。 Associate の内容を前提にした上位試験。まず roadmap-associate.md を終えてから取り組むのが定石です。 全体像は databricks-overview.md を参照。図は Mermaid 記法(VSCode プレビュー / GitHub で表示)。
目次
- 前提と到達目標
- 試験スペック
- Associate との違い
- 出題範囲(10ドメイン)
- 学習ロードマップ全体像
- 週次スケジュール(10週間モデル)
- ドメイン別 学習チェックリスト
- ハンズオン課題(本番運用レベル)
- 問題演習と時間戦略
- 日本語リソース集
- 受験直前・当日チェック
1. 前提と到達目標
| 項目 | 内容 |
|---|---|
| ゴール | Databricks Certified Data Engineer Professional に合格(70%以上) |
| 想定期間 | 週 6〜10 時間 × 8〜12 週間 |
| 強く推奨する前提 | Associate 合格 + 実務で PySpark を触った経験(2〜3ヶ月以上) |
| 必須ではないが有利 | Structured Streaming、Delta 内部構造、CI/CD の実務経験 |
| キーワード | 「用語暗記」ではなく 「シナリオで最適解を選ぶ」実装・運用判断 |
⚠️ Associate は「基礎タスクができるか」、Professional は「本番運用グレードのパイプラインを設計・最適化・トラブルシュートできるか」を問う試験。Associate 合格者でも難しいと言われます。
2. 試験スペック
| 項目 | 内容 |
|---|---|
| 問題数 | 59 問(選択式) |
| 制限時間 | 120 分 |
| 合格ライン | 70% 以上 |
| 費用 | 200 USD |
| 有効期限 | 2 年間 |
| 受験形式 | オンライン監督 or テストセンター |
| 言語 | 日本語で受験可能(※申込時に要確認。用語は英語で覚える) |
| 申込 | Webassessor |
3. Associate との違い
| 観点 | Associate | Professional |
|---|---|---|
| 問題数 / 時間 | 45問 / 90分 | 59問 / 120分 |
| 出題領域 | 7セクション | 10ドメイン |
| コード | SQL 中心でも可 | PySpark コード読解が中心(比重大) |
| 問題文 | 比較的短い | 長いシナリオ形式(読解量が多い) |
| 深さ | 基礎タスク | 設計・最適化・監視・セキュリティ・デバッグ |
| 追加領域 | — | Structured Streaming、Delta 高度機能、データモデリング(SCD) |
一番の違いは「Python(PySpark)コードを読んで挙動を答える」問題の多さ(開発ドメインだけで 22%)。手を動かした量がそのまま点になります。
4. 出題範囲(10ドメイン)
2026 年版の 10 ドメインと比率です(正確な値は最新公式ガイドで確認)。
| ドメイン | 比率 | 中身 |
|---|---|---|
| Python/SQL コード開発 | 22% | PySpark DataFrame、UDF、ウィンドウ関数、複雑な変換 |
| コスト・パフォーマンス最適化 | 13% | OPTIMIZE、Liquid Clustering、パーティション、キャッシュ、コスト設計 |
| データ変換・クレンジング・品質 | 10% | Expectations、品質保証、スキーマ管理 |
| モニタリング・アラート | 10% | ジョブ監視、メトリクス、アラート設定 |
| セキュリティ・コンプライアンス | 10% | Unity Catalog 権限、行/列レベル制御、機密データ |
| デバッグ・デプロイ | 10% | Spark UI、CI/CD、Asset Bundles、Git |
| データインジェスト | 7% | Auto Loader、Lakeflow Connect、Structured Streaming 取り込み |
| データガバナンス | 7% | リネージ、カタログ設計、タグ |
| データモデリング | 6% | SCD(履歴管理)、ディメンションモデル |
| データ共有・フェデレーション | 5% | Delta Sharing、外部データ連携 |
5. 学習ロードマップ全体像
Associate との差分にリソースを集中するのがコツ。基礎(Delta 基本、Jobs 基本)は復習程度にとどめ、PySpark 実装・Streaming・最適化・監視・CI/CD に時間を割く。
6. 週次スケジュール(10週間モデル)
| 週 | 重点 | 具体アクション |
|---|---|---|
| 1週目 | ギャップ分析 | 公式ガイド精読/10ドメインを自己採点し弱点を特定 |
| 2〜3週目 | PySpark 深化 | DataFrame API・UDF・ウィンドウ関数・複雑な join を自分で書く |
| 4〜5週目 | Streaming/最適化 | Structured Streaming、OPTIMIZE/Liquid Clustering、パーティション設計 |
| 6週目 | 監視 | ジョブ監視・アラート、Spark UI での性能診断 |
| 7週目 | セキュリティ/CI-CD | Unity Catalog 権限(行/列レベル)、Asset Bundles、Git、SCD |
| 8週目 | 演習① | 公式練習問題/長文シナリオを読み切る訓練 |
| 9週目 | 演習② | 日本語模擬問題集を周回、弱点ドメインを重点補強 |
| 10週目 | 仕上げ | 120分の時間配分を本番想定で練習/9割固め/受験 |
7. ドメイン別 学習チェックリスト
① Python/SQL コード開発(最重要 22%)
- [ ] DataFrame API を空で書ける(
select/filter/withColumn/join/agg) - [ ] ウィンドウ関数(
row_number/rank/lag/lead) - [ ] UDF・pandas UDF の定義と性能特性
- [ ] 複雑なネスト構造(struct/array/map)の展開(
explode等) - [ ] PySpark コードを読んで出力・挙動を予測できる
② コスト・パフォーマンス最適化(13%)
- [ ]
OPTIMIZE/ZORDER/ Liquid Clustering の使い分け - [ ] パーティショニング設計、ファイルサイズ問題(small files)
- [ ] キャッシュ、ブロードキャスト join、シャッフル削減
- [ ] Photon・サーバーレスのコスト特性
③ データ変換・品質(10%)
- [ ] 宣言的パイプラインの Expectations で品質保証
- [ ] スキーマ進化・スキーマ強制
- [ ] 冪等(idempotent)な変換設計
④ モニタリング・アラート(10%)
- [ ] ジョブ/パイプラインのメトリクス取得
- [ ] アラート設定、失敗検知、SLA 監視
⑤ セキュリティ・コンプライアンス(10%)
- [ ] Unity Catalog の権限モデル、行/列レベルセキュリティ
- [ ] 動的ビュー、機密データのマスキング
- [ ] 監査ログの活用
⑥ デバッグ・デプロイ(10%)
- [ ] Spark UI でステージ/タスク/シャッフル/スキューを読む
- [ ] OOM・データスキューの切り分けと対処
- [ ] Asset Bundles による CI/CD、Git Folders 運用
⑦ データインジェスト(7%)
- [ ] Structured Streaming の取り込み(
readStream/writeStream) - [ ] チェックポイント、
trigger、foreachBatch - [ ] Auto Loader の増分・スキーマ推論
⑧ データガバナンス(7%)
- [ ] カタログ/スキーマ設計、リネージ、タグ運用
⑨ データモデリング(6%)
- [ ] SCD Type 1 / Type 2(履歴管理)を
MERGEで実装 - [ ] ディメンション/ファクトの設計
⑩ データ共有・フェデレーション(5%)
- [ ] Delta Sharing の仕組み、外部データ連携
8. ハンズオン課題(本番運用レベル)
Associate より一段深く、運用を意識した課題に取り組みます。
💡 手順・コード付きの詳細版は ../06_hands-on/handson-professional.md(全15課題)にあります。 無料の Databricks Free Edition で実行でき、「Free Edition では練習できない論点(Spark UI 診断・クラスターサイズ設計・Delta Sharing など)をどう補うか」は ../06_hands-on/00-free-edition.md にまとめています。
- ストリーミング取り込み:Structured Streaming + Auto Loader で、チェックポイント付きの増分パイプラインを構築
- SCD Type 2:
MERGE INTOでディメンションテーブルの履歴管理を実装 - 品質ゲート:宣言的パイプラインに Expectations を入れ、不良データを隔離
- 最適化 before/after:わざと small files / スキューを作り、
OPTIMIZE・Liquid Clustering・パーティション調整で改善。Spark UI で数値比較 - 行/列レベルセキュリティ:Unity Catalog で動的ビューを作り、ユーザー属性でマスキング
- 監視・アラート:ジョブ失敗時に通知が飛ぶよう設定
- CI/CD:全体を Asset Bundle 化し、Git 経由で dev→prod にデプロイ
9. 問題演習と時間戦略
- 最大の敵は時間。問題文が長いので、まず結論(何を問うているか)を掴む訓練を積む。
- 公式練習問題を軸に、日本語模擬問題集で量をこなす。用語は必ず英語で暗記(長文+翻訳の曖昧さが命取り)→ ../07_reference/glossary.md を使う。
- 本番前に 120 分フルで通し練習し、時間配分を体に入れる → 本リポジトリの ../08_mock-exam/mock-professional.md(59問 / 120分・配点比例) を最低 2 回。採点表でドメイン別の弱点を特定できる。
- 数値・DBR バージョン境界は ../07_reference/cheatsheet-numbers.md で直前に詰める。
10. 日本語リソース集
| 種別 | リソース |
|---|---|
| 公式 | Professional 認定 公式ページ |
| 公式ガイド | Professional Exam Guide(2025年11月版 PDF) |
| 模擬問題 | 日本語試験問題集(Qiita) |
| 模擬問題 | 日本語版 模擬試験(Udemy) |
| 模擬問題 | プロフェッショナル 模擬問題集 2026(Udemy) |
| 全体像 | Databricksの認定資格 全部とってみた(Qiita) |
11. 受験直前・当日チェック
- [ ] Webassessor で申込・言語設定を確認
- [ ] 公式練習問題で安定して 9 割、かつ 120 分以内に解き切れる
- [ ] 長文を読み切るスタミナ(本番想定の通し練習を最低 2 回)
- [ ] 用語の英語表記を最終確認(Structured Streaming, Liquid Clustering, SCD, Asset Bundles…)
- [ ] オンライン受験環境(本人確認・個室・回線・カメラ)を事前テスト
- [ ] 1 問約 2 分。迷ったらフラグ→後回しで全問到達を優先
Associate → 実務 → Professional の順で、手を動かす期間を挟むのが合格への近道です。学習の土台は databricks-overview.md、基礎ロードマップは roadmap-associate.md を参照。
10 ドメイン別の学習教材(公式ドキュメントの書き起こし)は ../04_professional-materials/00-index.md にあります。