Skip to content

Databricks Data Engineer Professional 取得ロードマップ

Databricks 認定データエンジニア プロフェッショナル(Professional)合格までの学習ロードマップです。 Associate の内容を前提にした上位試験。まず roadmap-associate.md を終えてから取り組むのが定石です。 全体像は databricks-overview.md を参照。図は Mermaid 記法(VSCode プレビュー / GitHub で表示)。

目次

  1. 前提と到達目標
  2. 試験スペック
  3. Associate との違い
  4. 出題範囲(10ドメイン)
  5. 学習ロードマップ全体像
  6. 週次スケジュール(10週間モデル)
  7. ドメイン別 学習チェックリスト
  8. ハンズオン課題(本番運用レベル)
  9. 問題演習と時間戦略
  10. 日本語リソース集
  11. 受験直前・当日チェック

1. 前提と到達目標

項目内容
ゴールDatabricks Certified Data Engineer Professional に合格(70%以上)
想定期間週 6〜10 時間 × 8〜12 週間
強く推奨する前提Associate 合格 + 実務で PySpark を触った経験(2〜3ヶ月以上)
必須ではないが有利Structured Streaming、Delta 内部構造、CI/CD の実務経験
キーワード「用語暗記」ではなく 「シナリオで最適解を選ぶ」実装・運用判断

⚠️ Associate は「基礎タスクができるか」、Professional は「本番運用グレードのパイプラインを設計・最適化・トラブルシュートできるか」を問う試験。Associate 合格者でも難しいと言われます。


2. 試験スペック

項目内容
問題数59 問(選択式)
制限時間120 分
合格ライン70% 以上
費用200 USD
有効期限2 年間
受験形式オンライン監督 or テストセンター
言語日本語で受験可能(※申込時に要確認。用語は英語で覚える
申込Webassessor

3. Associate との違い

観点AssociateProfessional
問題数 / 時間45問 / 90分59問 / 120分
出題領域7セクション10ドメイン
コードSQL 中心でも可PySpark コード読解が中心(比重大)
問題文比較的短い長いシナリオ形式(読解量が多い)
深さ基礎タスク設計・最適化・監視・セキュリティ・デバッグ
追加領域Structured Streaming、Delta 高度機能、データモデリング(SCD)

一番の違いは「Python(PySpark)コードを読んで挙動を答える」問題の多さ(開発ドメインだけで 22%)。手を動かした量がそのまま点になります。


4. 出題範囲(10ドメイン)

2026 年版の 10 ドメインと比率です(正確な値は最新公式ガイドで確認)。

ドメイン比率中身
Python/SQL コード開発22%PySpark DataFrame、UDF、ウィンドウ関数、複雑な変換
コスト・パフォーマンス最適化13%OPTIMIZE、Liquid Clustering、パーティション、キャッシュ、コスト設計
データ変換・クレンジング・品質10%Expectations、品質保証、スキーマ管理
モニタリング・アラート10%ジョブ監視、メトリクス、アラート設定
セキュリティ・コンプライアンス10%Unity Catalog 権限、行/列レベル制御、機密データ
デバッグ・デプロイ10%Spark UI、CI/CD、Asset Bundles、Git
データインジェスト7%Auto Loader、Lakeflow Connect、Structured Streaming 取り込み
データガバナンス7%リネージ、カタログ設計、タグ
データモデリング6%SCD(履歴管理)、ディメンションモデル
データ共有・フェデレーション5%Delta Sharing、外部データ連携

5. 学習ロードマップ全体像

Associate との差分にリソースを集中するのがコツ。基礎(Delta 基本、Jobs 基本)は復習程度にとどめ、PySpark 実装・Streaming・最適化・監視・CI/CD に時間を割く。


6. 週次スケジュール(10週間モデル)

重点具体アクション
1週目ギャップ分析公式ガイド精読/10ドメインを自己採点し弱点を特定
2〜3週目PySpark 深化DataFrame API・UDF・ウィンドウ関数・複雑な join を自分で書く
4〜5週目Streaming/最適化Structured Streaming、OPTIMIZE/Liquid Clustering、パーティション設計
6週目監視ジョブ監視・アラート、Spark UI での性能診断
7週目セキュリティ/CI-CDUnity Catalog 権限(行/列レベル)、Asset Bundles、Git、SCD
8週目演習①公式練習問題/長文シナリオを読み切る訓練
9週目演習②日本語模擬問題集を周回、弱点ドメインを重点補強
10週目仕上げ120分の時間配分を本番想定で練習/9割固め/受験

7. ドメイン別 学習チェックリスト

① Python/SQL コード開発(最重要 22%)

  • [ ] DataFrame API を空で書けるselect/filter/withColumn/join/agg
  • [ ] ウィンドウ関数row_number/rank/lag/lead
  • [ ] UDF・pandas UDF の定義と性能特性
  • [ ] 複雑なネスト構造(struct/array/map)の展開(explode 等)
  • [ ] PySpark コードを読んで出力・挙動を予測できる

② コスト・パフォーマンス最適化(13%)

  • [ ] OPTIMIZE / ZORDER / Liquid Clustering の使い分け
  • [ ] パーティショニング設計、ファイルサイズ問題(small files)
  • [ ] キャッシュ、ブロードキャスト join、シャッフル削減
  • [ ] Photon・サーバーレスのコスト特性

③ データ変換・品質(10%)

  • [ ] 宣言的パイプラインの Expectations で品質保証
  • [ ] スキーマ進化・スキーマ強制
  • [ ] 冪等(idempotent)な変換設計

④ モニタリング・アラート(10%)

  • [ ] ジョブ/パイプラインのメトリクス取得
  • [ ] アラート設定、失敗検知、SLA 監視

⑤ セキュリティ・コンプライアンス(10%)

  • [ ] Unity Catalog の権限モデル、行/列レベルセキュリティ
  • [ ] 動的ビュー、機密データのマスキング
  • [ ] 監査ログの活用

⑥ デバッグ・デプロイ(10%)

  • [ ] Spark UI でステージ/タスク/シャッフル/スキューを読む
  • [ ] OOM・データスキューの切り分けと対処
  • [ ] Asset Bundles による CI/CD、Git Folders 運用

⑦ データインジェスト(7%)

  • [ ] Structured Streaming の取り込み(readStream/writeStream
  • [ ] チェックポイント、triggerforeachBatch
  • [ ] Auto Loader の増分・スキーマ推論

⑧ データガバナンス(7%)

  • [ ] カタログ/スキーマ設計、リネージ、タグ運用

⑨ データモデリング(6%)

  • [ ] SCD Type 1 / Type 2(履歴管理)を MERGE で実装
  • [ ] ディメンション/ファクトの設計

⑩ データ共有・フェデレーション(5%)

  • [ ] Delta Sharing の仕組み、外部データ連携

8. ハンズオン課題(本番運用レベル)

Associate より一段深く、運用を意識した課題に取り組みます。

💡 手順・コード付きの詳細版は ../06_hands-on/handson-professional.md(全15課題)にあります。 無料の Databricks Free Edition で実行でき、「Free Edition では練習できない論点(Spark UI 診断・クラスターサイズ設計・Delta Sharing など)をどう補うか」は ../06_hands-on/00-free-edition.md にまとめています。

  1. ストリーミング取り込み:Structured Streaming + Auto Loader で、チェックポイント付きの増分パイプラインを構築
  2. SCD Type 2MERGE INTO でディメンションテーブルの履歴管理を実装
  3. 品質ゲート:宣言的パイプラインに Expectations を入れ、不良データを隔離
  4. 最適化 before/after:わざと small files / スキューを作り、OPTIMIZE・Liquid Clustering・パーティション調整で改善。Spark UI で数値比較
  5. 行/列レベルセキュリティ:Unity Catalog で動的ビューを作り、ユーザー属性でマスキング
  6. 監視・アラート:ジョブ失敗時に通知が飛ぶよう設定
  7. CI/CD:全体を Asset Bundle 化し、Git 経由で dev→prod にデプロイ

9. 問題演習と時間戦略

  • 最大の敵は時間。問題文が長いので、まず結論(何を問うているか)を掴む訓練を積む。
  • 公式練習問題を軸に、日本語模擬問題集で量をこなす。用語は必ず英語で暗記(長文+翻訳の曖昧さが命取り)→ ../07_reference/glossary.md を使う。
  • 本番前に 120 分フルで通し練習し、時間配分を体に入れる → 本リポジトリの ../08_mock-exam/mock-professional.md(59問 / 120分・配点比例) を最低 2 回。採点表でドメイン別の弱点を特定できる。
  • 数値・DBR バージョン境界は ../07_reference/cheatsheet-numbers.md で直前に詰める。

10. 日本語リソース集

種別リソース
公式Professional 認定 公式ページ
公式ガイドProfessional Exam Guide(2025年11月版 PDF)
模擬問題日本語試験問題集(Qiita)
模擬問題日本語版 模擬試験(Udemy)
模擬問題プロフェッショナル 模擬問題集 2026(Udemy)
全体像Databricksの認定資格 全部とってみた(Qiita)

11. 受験直前・当日チェック

  • [ ] Webassessor で申込・言語設定を確認
  • [ ] 公式練習問題で安定して 9 割、かつ 120 分以内に解き切れる
  • [ ] 長文を読み切るスタミナ(本番想定の通し練習を最低 2 回)
  • [ ] 用語の英語表記を最終確認(Structured Streaming, Liquid Clustering, SCD, Asset Bundles…)
  • [ ] オンライン受験環境(本人確認・個室・回線・カメラ)を事前テスト
  • [ ] 1 問約 2 分。迷ったらフラグ→後回しで全問到達を優先

Associate → 実務 → Professional の順で、手を動かす期間を挟むのが合格への近道です。学習の土台は databricks-overview.md、基礎ロードマップは roadmap-associate.md を参照。

10 ドメイン別の学習教材(公式ドキュメントの書き起こし)は ../04_professional-materials/00-index.md にあります。