Skip to content

Databricks Data Engineer Professional 取得ロードマップ ​

Databricks 認定データエンジニア プロフェッショナル(Professional)合格までの学習ロードマップです。 Associate の内容を前提にした上位試験。まず roadmap-associate.md を終えてから取り組むのが定石です。 全体像は databricks-overview.md を参照。図は Mermaid 記法(VSCode プレビュー / GitHub で表示)。

目次 ​

  1. 前提と到達目標
  2. 試験スペック
  3. Associate との違い
  4. 出題範囲(10ドメイン)
  5. 学習ロードマップ全体像
  6. 週次スケジュール(10週間モデル)
  7. ドメイン別 学習チェックリスト
  8. ハンズオン課題(本番運用レベル)
  9. 問題演習と時間戦略
  10. 日本語リソース集
  11. 受験直前・当日チェック

1. 前提と到達目標 ​

項目内容
ゴールDatabricks Certified Data Engineer Professional に合格(70%以上)
想定期間週 6〜10 時間 × 8〜12 週間
強く推奨する前提Associate 合格 + 実務で PySpark を触った経験(2〜3ヶ月以上)
必須ではないが有利Structured Streaming、Delta 内部構造、CI/CD の実務経験
キーワード「用語暗記」ではなく 「シナリオで最適解を選ぶ」実装・運用判断

⚠️ Associate は「基礎タスクができるか」、Professional は「本番運用グレードのパイプラインを設計・最適化・トラブルシュートできるか」を問う試験。Associate 合格者でも難しいと言われます。


2. 試験スペック ​

項目内容
問題数59 問(選択式)
制限時間120 分
合格ライン70% 以上
費用200 USD
有効期限2 年間
受験形式オンライン監督 or テストセンター
言語日本語で受験可能(※申込時に要確認。用語は英語で覚える)
申込Webassessor

3. Associate との違い ​

観点AssociateProfessional
問題数 / 時間45問 / 90分59問 / 120分
出題領域7セクション10ドメイン
コードSQL 中心でも可PySpark コード読解が中心(比重大)
問題文比較的短い長いシナリオ形式(読解量が多い)
深さ基礎タスク設計・最適化・監視・セキュリティ・デバッグ
追加領域—Structured Streaming、Delta 高度機能、データモデリング(SCD)

一番の違いは「Python(PySpark)コードを読んで挙動を答える」問題の多さ(開発ドメインだけで 22%)。手を動かした量がそのまま点になります。


4. 出題範囲(10ドメイン) ​

2026 年版の 10 ドメインと比率です(正確な値は最新公式ガイドで確認)。

ドメイン比率中身
Python/SQL コード開発22%PySpark DataFrame、UDF、ウィンドウ関数、複雑な変換
コスト・パフォーマンス最適化13%OPTIMIZE、Liquid Clustering、パーティション、キャッシュ、コスト設計
データ変換・クレンジング・品質10%Expectations、品質保証、スキーマ管理
モニタリング・アラート10%ジョブ監視、メトリクス、アラート設定
セキュリティ・コンプライアンス10%Unity Catalog 権限、行/列レベル制御、機密データ
デバッグ・デプロイ10%Spark UI、CI/CD、Asset Bundles、Git
データインジェスト7%Auto Loader、Lakeflow Connect、Structured Streaming 取り込み
データガバナンス7%リネージ、カタログ設計、タグ
データモデリング6%SCD(履歴管理)、ディメンションモデル
データ共有・フェデレーション5%Delta Sharing、外部データ連携

5. 学習ロードマップ全体像 ​

Associate との差分にリソースを集中するのがコツ。基礎(Delta 基本、Jobs 基本)は復習程度にとどめ、PySpark 実装・Streaming・最適化・監視・CI/CD に時間を割く。


6. 週次スケジュール(10週間モデル) ​

週重点具体アクション
1週目ギャップ分析公式ガイド精読/10ドメインを自己採点し弱点を特定
2〜3週目PySpark 深化DataFrame API・UDF・ウィンドウ関数・複雑な join を自分で書く
4〜5週目Streaming/最適化Structured Streaming、OPTIMIZE/Liquid Clustering、パーティション設計
6週目監視ジョブ監視・アラート、Spark UI での性能診断
7週目セキュリティ/CI-CDUnity Catalog 権限(行/列レベル)、Asset Bundles、Git、SCD
8週目演習①公式練習問題/長文シナリオを読み切る訓練
9週目演習②日本語模擬問題集を周回、弱点ドメインを重点補強
10週目仕上げ120分の時間配分を本番想定で練習/9割固め/受験

7. ドメイン別 学習チェックリスト ​

① Python/SQL コード開発(最重要 22%) ​

  • [ ] DataFrame API を空で書ける(select/filter/withColumn/join/agg)
  • [ ] ウィンドウ関数(row_number/rank/lag/lead)
  • [ ] UDF・pandas UDF の定義と性能特性
  • [ ] 複雑なネスト構造(struct/array/map)の展開(explode 等)
  • [ ] PySpark コードを読んで出力・挙動を予測できる

② コスト・パフォーマンス最適化(13%) ​

  • [ ] OPTIMIZE / ZORDER / Liquid Clustering の使い分け
  • [ ] パーティショニング設計、ファイルサイズ問題(small files)
  • [ ] キャッシュ、ブロードキャスト join、シャッフル削減
  • [ ] Photon・サーバーレスのコスト特性

③ データ変換・品質(10%) ​

  • [ ] 宣言的パイプラインの Expectations で品質保証
  • [ ] スキーマ進化・スキーマ強制
  • [ ] 冪等(idempotent)な変換設計

④ モニタリング・アラート(10%) ​

  • [ ] ジョブ/パイプラインのメトリクス取得
  • [ ] アラート設定、失敗検知、SLA 監視

⑤ セキュリティ・コンプライアンス(10%) ​

  • [ ] Unity Catalog の権限モデル、行/列レベルセキュリティ
  • [ ] 動的ビュー、機密データのマスキング
  • [ ] 監査ログの活用

⑥ デバッグ・デプロイ(10%) ​

  • [ ] Spark UI でステージ/タスク/シャッフル/スキューを読む
  • [ ] OOM・データスキューの切り分けと対処
  • [ ] Asset Bundles による CI/CD、Git Folders 運用

⑦ データインジェスト(7%) ​

  • [ ] Structured Streaming の取り込み(readStream/writeStream)
  • [ ] チェックポイント、trigger、foreachBatch
  • [ ] Auto Loader の増分・スキーマ推論

⑧ データガバナンス(7%) ​

  • [ ] カタログ/スキーマ設計、リネージ、タグ運用

⑨ データモデリング(6%) ​

  • [ ] SCD Type 1 / Type 2(履歴管理)を MERGE で実装
  • [ ] ディメンション/ファクトの設計

⑩ データ共有・フェデレーション(5%) ​

  • [ ] Delta Sharing の仕組み、外部データ連携

8. ハンズオン課題(本番運用レベル) ​

Associate より一段深く、運用を意識した課題に取り組みます。

💡 手順・コード付きの詳細版は ../06_hands-on/handson-professional.md(全15課題)にあります。 無料の Databricks Free Edition で実行でき、「Free Edition では練習できない論点(Spark UI 診断・クラスターサイズ設計・Delta Sharing など)をどう補うか」は ../06_hands-on/00-free-edition.md にまとめています。

  1. ストリーミング取り込み:Structured Streaming + Auto Loader で、チェックポイント付きの増分パイプラインを構築
  2. SCD Type 2:MERGE INTO でディメンションテーブルの履歴管理を実装
  3. 品質ゲート:宣言的パイプラインに Expectations を入れ、不良データを隔離
  4. 最適化 before/after:わざと small files / スキューを作り、OPTIMIZE・Liquid Clustering・パーティション調整で改善。Spark UI で数値比較
  5. 行/列レベルセキュリティ:Unity Catalog で動的ビューを作り、ユーザー属性でマスキング
  6. 監視・アラート:ジョブ失敗時に通知が飛ぶよう設定
  7. CI/CD:全体を Asset Bundle 化し、Git 経由で dev→prod にデプロイ

9. 問題演習と時間戦略 ​

  • 最大の敵は時間。問題文が長いので、まず結論(何を問うているか)を掴む訓練を積む。
  • 公式練習問題を軸に、日本語模擬問題集で量をこなす。用語は必ず英語で暗記(長文+翻訳の曖昧さが命取り)→ ../07_reference/glossary.md を使う。
  • 本番前に 120 分フルで通し練習し、時間配分を体に入れる → 本リポジトリの ../08_mock-exam/mock-professional.md(59問 / 120分・配点比例) を最低 2 回。採点表でドメイン別の弱点を特定できる。
  • 数値・DBR バージョン境界は ../07_reference/cheatsheet-numbers.md で直前に詰める。

10. 日本語リソース集 ​

種別リソース
公式Professional 認定 公式ページ
公式ガイドProfessional Exam Guide(2025年11月版 PDF)
模擬問題日本語試験問題集(Qiita)
模擬問題日本語版 模擬試験(Udemy)
模擬問題プロフェッショナル 模擬問題集 2026(Udemy)
全体像Databricksの認定資格 全部とってみた(Qiita)

11. 受験直前・当日チェック ​

  • [ ] Webassessor で申込・言語設定を確認
  • [ ] 公式練習問題で安定して 9 割、かつ 120 分以内に解き切れる
  • [ ] 長文を読み切るスタミナ(本番想定の通し練習を最低 2 回)
  • [ ] 用語の英語表記を最終確認(Structured Streaming, Liquid Clustering, SCD, Asset Bundles…)
  • [ ] オンライン受験環境(本人確認・個室・回線・カメラ)を事前テスト
  • [ ] 1 問約 2 分。迷ったらフラグ→後回しで全問到達を優先

Associate → 実務 → Professional の順で、手を動かす期間を挟むのが合格への近道です。学習の土台は databricks-overview.md、基礎ロードマップは roadmap-associate.md を参照。

10 ドメイン別の学習教材(公式ドキュメントの書き起こし)は ../04_professional-materials/00-index.md にあります。