Skip to content

数値・バージョン境界チートシート(直前 1 枚)

試験で「どの数値か」「どの DBR バージョンから使えるか」を問う問題は確実に出ます。教材に散在する数値をここに集約しました。 範囲: A = Associate 中心 / P = Professional 中心 / A/P = 両方。 用語そのものは glossary.md を参照してください。

使い方

  1. 右列(値)を隠して言えるか確認する
  2. 言えなかった行の教材の節に戻る
  3. 受験前日・当日にこのファイルだけを 2 周する

1. 試験スペック

項目AssociateProfessional
問題数45 問59 問(採点対象。未採点問題が加わることがある)
制限時間90 分120 分
1 問あたり約 2 分約 2 分
合格ライン70% 以上70% 以上
費用200 USD200 USD
有効期限2 年間2 年間

Professional のドメイン配点(公式): ① コード開発 22% / ② コスト・性能 13% / ③ 変換・品質 10% / ④ 監視 10% / ⑤ セキュリティ 10% / ⑥ デバッグ・デプロイ 10% / ⑦ インジェスト 7% / ⑧ ガバナンス 7% / ⑨ モデリング 6% / ⑩ 共有・フェデレーション 5%


2. Delta Lake / テーブル

項目範囲
既定のテーブル形式Delta Lake(特に指定しない限り全テーブル)A
データスキップの統計収集列既定で先頭 32 列A/P
VACUUM 既定保持期間7 日delta.deletedFileRetentionDurationA/P
VACUUM 推奨保持期間7 日以上を強く推奨A/P
ログファイルの既定保持30 日VACUUM の管理外、チェックポイント後に非同期削除)A/P
VACUUM DRY RUN の一覧上限最大 1000 件表示A
VACUUM 推奨クラスターワーカー 1〜4(各 8 コア)で自動スケール + ドライバー 8〜32 コアP
VACUUM チューニング目安10,000 ファイル超削除 or 30 分超ならドライバー/ワーカーを増やすP
Iceberg テーブルの保持期間7 日で固定A
Delta ライター/リーダーバージョン(液体クラスタリング)ライター 7 / リーダー 3(ダウングレード不可)A/P

3. 液体クラスタリング

項目範囲
クラスタリングキーの最大数4A/P
キーに使える列統計が収集された列(既定で先頭 32 列)A/P
キーを増やすと遅くなる境界10 TB 未満のテーブルで単一列フィルターが遅くなりうる(4 キー < 2 キー)P
キーにできない型複合型そのものStructType / MapType / ArrayType)、配列/マップ要素P
キーにできる型Date, Timestamp, TimestampNTZ, String, Integer/Long/Short/Byte, Float/Double/Decimal、構造体フィールド(ドット表記・任意の深さ)P
書き込み時クラスタリングのしきい値(UC マネージド)1 キー 64 MB / 2 キー 256 MB / 3 キー 512 MB / 4 キー 1 GBP
書き込み時クラスタリングのしきい値(その他 Delta)1 キー 256 MB / 2 キー 1 GB / 3 キー 2 GB / 4 キー 4 GBP
ストリーミングでのトリガー条件直近 5 回のストリーミング更新の少なくとも 1 回がしきい値超過P
更新/挿入が多いテーブルの OPTIMIZE 頻度1〜2 時間ごとを推奨P
OPTIMIZE の推奨実行開始頻度まず毎日、その後コスト/性能で調整P

4. ファイルサイズ

項目範囲
テーブルサイズ別の自動チューニング(< 2.56 TB)ターゲット 256 MBP
(2.56 TB〜10 TB)256 MB → 1 GB へ線形に増加P
(> 10 TB)ターゲット 1 GBP
自動圧縮 / 最適化された書き込みを true にした場合128 MB 固定P
最適化された書き込みが常に有効(オフ不可)な操作MERGE / サブクエリ付き UPDATEDELETEP
「小さいファイル」の目安8 MB を下回らないようにする(数万ファイルなら small files 問題)P
OPTIMIZE のスケジュール実行推奨1 TB 超のテーブルP

5. パーティション設計

項目範囲
パーティション分割しない目安1 TB 未満のテーブルA/P
パーティション分割する条件各パーティションが 1 GB 以上になる見込みの列A/P
新規テーブルの推奨パーティションではなく液体クラスタリングA/P

6. AQE(アダプティブクエリ実行)

プロパティ既定値範囲
spark.databricks.optimizer.adaptive.enabledtrue(既定で有効)A/P
spark.sql.shuffle.partitions200auto で自動最適化シャッフル)P
spark.databricks.adaptive.autoBroadcastJoinThreshold30MBP
spark.sql.adaptive.coalescePartitions.enabledtrueP
spark.sql.adaptive.advisoryPartitionSizeInBytes64MBP
spark.sql.adaptive.coalescePartitions.minPartitionSize1MBP
spark.sql.adaptive.coalescePartitions.minPartitionNumクラスターコア数の 2 倍(非推奨設定)P
spark.sql.adaptive.skewJoin.enabledtrueP
spark.sql.adaptive.skewJoin.skewedPartitionFactor5P
spark.sql.adaptive.skewJoin.skewedPartitionThresholdInBytes256MBP
spark.databricks.adaptive.emptyRelationPropagation.enabledtrueP

スキュー判定条件: 「サイズ > factor(5) × 中央値サイズ」かつ「サイズ > 256MB」の両方を満たすとき AQE の 4 機能: ①ソートマージ → ブロードキャストへ動的切替 ②パーティションの動的結合 ③スキュー結合の動的処理 ④空リレーションの検出・伝播 AQE がやらないこと: 結合順序の自動変更(動的結合並べ替え)は AQE の一部ではない

7. Spark UI 診断

項目範囲
スキュー判定タスク時間の Max が 75 パーセンタイルより 50% 以上長いA/P
健全なステージ75 パーセンタイルと Max がほぼ同じA/P
ジョブタイムラインのギャップ1 分以上の空白を探す(短い中断は正常)P
「多数の小さなジョブ」の目安数秒以下の小さなジョブが大量、データ < 10 GBA/P
タスク数が問題のサインタスクが 1 つだけ(並列化されていない)P
診断順序①タイムライン → ②最長ステージ → ③スピル → ④スキュー → ⑤I/O 依存 → ⑥その他A/P
Executor 削除の 3 理由①自動スケール(正常) ②スポットインスタンス損失 ③Executor OOMP

8. Auto Loader / インジェスト

項目範囲
スキーマ推論のサンプリング先頭 50 GB または 1000 ファイル(先に達した方)A/P
JSON / CSV / XML の既定推論型すべて文字列(JSON の入れ子含む)A/P
型推論を有効にするcloudFiles.inferColumnTypes=trueA/P
既定のスキーマ進化モード(スキーマ未指定時)addNewColumnsP
既定のスキーマ進化モード(スキーマ指定時)noneP
cloudFiles.maxFilesPerTrigger既定 1000(ハード上限)P
cloudFiles.maxBytesPerTriggerソフト上限(未設定が既定)P
cloudFiles.maxFileAge最小 14 days、推奨は 90 日程度P
Auto Loader のスケール数十億ファイル、毎時数百万ファイルまでA/P
COPY INTOFILES 上限1000 ファイルPATTERN併用不可A
COPY INTOVALIDATE n ROWS50 未満だとプレビュー返却A
Delta ストリーミングソースの maxFilesPerTrigger既定 1000P

9. Structured Streaming

項目範囲
トリガー未設定時の挙動processingTime=0数ミリ秒ごと)→ 予期しないクラウド課金P
既定のレイテンシ目安(トリガー未指定)3〜5 秒P
Trigger.Once の非推奨開始DBR 11.3 LTS 以降(→ AvailableNow を使う)P
リアルタイムモードのレイテンシ1 秒未満、代表 〜300ms(パブリックプレビュー)P
Trigger.AvailableNow の最小 DBRファイルソース 9.1 LTS / Delta・Auto Loader・Kafka 10.4 LTS / Kinesis 13.1P
Delta シンクの出力モードappend と complete のみupdate は非サポートP
Kafka シンクの出力モード全モードサポートP
結合の出力モードappend のみP
ストリーム結合の状態ストアインスタンスパーティションごとに 4 インスタンスP
複数ウォーターマークの既定ポリシーグローバルに最小値(minP
dropDuplicatesWithinWatermark の最小 DBR13.3 LTS 以降(ウォーターマーク指定が必須)P
ソーステーブル保持と再実行VACUUM 既定 7 日 / logRetentionDuration 30 日以内に少なくとも 1 回実行が必要P

10. Expectations / データ品質

項目範囲
3 アクションwarn(既定・保持)/ drop(削除)/ fail(更新失敗・アトミックにロールバック)A/P
メトリックが記録されないアクションfail(更新が失敗するため)A/P
グループ適用(expect_all 系)Python 限定A/P
期待値をサポートするデータセットストリーミングテーブル / 具体化ビュー / 一時ビューのみ(シンクは非対応)P
制約句に使えないものカスタム Python 関数 / 外部サービス呼び出し / 他テーブル参照サブクエリA/P
期待値名の一意性データセット内で一意(複数データセット間では再利用可)A/P
完全性の評価窓過去 24 時間の書き込み行数P

11. データ品質監視 / メトリック

項目範囲
メトリックテーブル名{table}_profile_metrics / {table}_drift_metricsP
分位点の配列1000 分位点(中央値は quantiles[500]P
頻出項目上位 100 頻出(frequent_itemsP
時系列/推論プロファイルの振り返り作成時刻から 30 日P
PSI の解釈< 0.1 有意な変化なし / < 0.2 中程度 / >= 0.2 有意な母集団変化P
カテゴリ列のドリフト指標カイ二乗検定 / TV 距離 / L∞距離 / JS 距離P
数値列のドリフト指標KS 検定 / Wasserstein 距離 / PSIP
ドリフト種別CONSECUTIVE(直前ウィンドウ)/ BASELINE(ベースラインテーブル提供時のみ)P

12. システムテーブル

テーブル無料保持データ範囲範囲
system.access.audit365 日WS レベル=リージョン / アカウントレベル=グローバルP
system.billing.usage365 日グローバルP
system.billing.list_prices不定グローバルP
system.lakeflow.jobs / job_tasks / job_run_timeline / job_task_run_timeline365 日リージョンP
system.compute.node_timeline90 日リージョンP
system.query.history365 日リージョンP
system.data_classification.results13 か月リージョンP
system.storage.predictive_optimization_operations_history180 日リージョンP
system.serving.endpoint_usage90 日リージョンP
system.access.table_lineage / column_lineage365 日(Catalog Explorer 表示は無期限リージョンP

その他の数値

  • タイムラインの 1 行あたり最大スライス: 1 時間result_state / termination_code は最終行のみ)
  • アカウントレベルイベント: workspace_id = **0**
  • リネージ利用可能開始日: 2024 年 9 月 1 日以降にキャプチャされたもののみ
  • ストリーミング利用時の設定: skipChangeCommits = true

13. アラート / 通知

項目範囲
SQL アラートの状態OK / TRIGGERED / ERRORUNKNOWN は廃止)P
ワークスペースのアクティブ実行クォータ既定 250 同時実行(超過時はアラート実行がスキップP
通知イベント種別ごとのシステム宛先ジョブ/タスクごと最大 3 つP
ストリーミングバックログ通知の判定10 分間の平均バックログP
ストリーミングバックログ通知のクールダウン送信後 30 分待って次を判断P
Email 宛先の文字数制限1,300 文字P
タスクの既定再試行回数3 回(「最後の再試行まで通知をミュート」の文脈)P

14. Unity Catalog / ガバナンス

項目範囲
メタストアの数リージョンごとに 1 つA/P
ネームスペースの階層数3 階層catalog.schema.object)。Hive は 2 階層A/P
1 オブジェクト(テーブル/列)あたりのタグ上限50P
1 テーブルの全列合計の列タグ上限1,000P
タグのキー/値の最大長256 文字P
タグキーに使えない文字. , - = / :(先頭/末尾のスペースも不可)P
タグキーの大文字小文字区別するSalessalesP
1 コマンドでの複数列タグ付与不可(列ごとに個別実行)P
ABAC の MATCH COLUMNS 上限最大 3 つP
権限継承が働かないレベルメタストアレベルCREATE CATALOG は子に継承されない)A/P
ALL PRIVILEGES に含まれないものMANAGE / EXTERNAL USE LOCATION / EXTERNAL USE SCHEMAP
Unity Catalog 自動有効化の開始日2023 年 11 月 9 日以降に作成されたワークスペースA
リネージのシステムテーブル保持ローリング 1 年P

15. セキュリティ(DBR バージョン境界が最重要)

項目範囲
行フィルターの個数1 テーブルに 1 つP
列マスクの個数1 列に 1 つP
行フィルター/列マスク: 標準アクセスモードDBR 12.2 LTS 以降P
行フィルター/列マスク: 専用アクセスモードDBR 15.4 LTS 以降(サーバーレス有効が前提)P
専用モードで読み取りのみの範囲DBR 15.4〜16.2P
専用モードで書き込みに必要DBR 16.3 以降P
DBR 12.2 LTS 未満非サポート=fail safe(アクセスしてもデータが返らない)P
動的ビュー: 専用アクセスモードDBR 15.4 LTS 以降(15.3 以下は読み取り不可)P
ABAC ポリシー作成DBR 16.4 以降 またはサーバーレスP
パーティション列ポリシーの DELETE/UPDATE/MERGEDBR 17.2 以降P
CURRENT_RECIPIENT()(共有の動的ビュー)DBR 14.2 以降P
ANSI モードの推奨spark.sql.ansi.enabled = true(無効だとサイレント NULL 化で誤結果)P

16. その他の DBR バージョン境界(頻出)

機能必要な DBR範囲
パフォーマンス強化が既定で有効10.4 LTS 以降A/P
ワークスペースファイルが既定で有効(バンドル前提)11.2 以降(11.3 LTS 以上を運用推奨)A/P
Trigger.Once の非推奨化11.3 LTS 以降P
StreamingQueryListener(Python/Scala)11.3 LTS 以降P
Delta 間ストリーミングの系列追跡11.3 LTS 以降P
WHEN NOT MATCHED BY SOURCE12.2 LTS 以降A/P
UPDATE SET * EXCEPT (...)12.2 LTS 以降A
ignoreChangesskipChangeCommits へ置換12.2 LTSP
予測的最適化の前提12.2 LTS 以降(または SQL ウェアハウス)P
液体クラスタリングのクラスタリングトリガー(OPTIMIZE13.3 LTS 以降P
ボリュームのサポート13.3 LTS 以降A
行追跡の書き込み13.3 LTS 以降P
dropDuplicatesWithinWatermark13.3 LTS 以降P
Lakeflow パイプラインの列系列追跡13.3 LTS 以降P
Lakehouse フェデレーション13.3 LTS 以降P
ALTER SHARE ADD SCHEMA13.3 LTS 以降P
スカラー Python UDF / pandas UDF が全アクセスモード対応13.3 LTS 以降P
DataFrameWriterV2clusterBy14.2 以降P
DataFrame / DeltaTable API で液体クラスタリング14.3 LTS 以降P
TimestampNTZ をクラスタリングキーに14.3 LTS 以降P
チェックポイント V2 が既定(液体クラスタリング作成時)14.3 LTS 以降P
MERGE WITH SCHEMA EVOLUTION15.2 以降A/P
StreamingQueryListener で UC 管理オブジェクトと対話15.1 以降(標準アクセスモードの Scala は 16.1 以降P
液体クラスタリング GA(Delta)15.4 LTS 以降A/P
自動液体クラスタリング(CLUSTER BY AUTO15.4 LTS 以降(UC マネージド Delta)A/P
SET TAG / UNSET TAG 構文16.1 以降P
複数一致の判定に WHEN MATCHED 条件も使う16.0 以降(15.4 LTS 以下は ON 条件のみ)P
OPTIMIZE FULL(強制再クラスタリング)16.0 以降(LTS は 16.4 LTS)A/P
VACUUM LITE / FULL モード16.1 以降A/P
液体クラスタリング(Iceberg)パブリックプレビュー16.4 LTS 以降P
構造化ストリーミング書き込みで液体クラスタリング有効テーブルを作成16.4 LTS 以降P
自動液体クラスタリングの Python API16.4 以降P
大きなテーブルの OPTIMIZE 性能向上17.3 LTS 以降推奨P
自動変更データフィード(読み取り時計算)DBR 18 以降(+ UC 登録・行追跡有効)P
deletedFileRetentionDuration で保持制御18.0 以降(UC マネージドは 12.2 以降)P
システムテーブルの Trigger.AvailableNow 追いつき18.0 以降P
マネージド Iceberg v3 機能(自動液体クラスタリング含む)18.0 以降P
予測的最適化のスキップ理由確認(... AS JSON18 以降P
ALTER TABLE ... REPLACE PARTITIONED BY WITH CLUSTER BY18.1 以降P
OPTIMIZE FULL WHERE <predicate>(部分再クラスタ)18.1 以降P
ソースの進化(queryEvolution.enableSourceEvolution18.2 以降P

17. CI/CD

項目範囲
バンドルに必要な Databricks CLIv0.218.0 以降A/P
CLI の GA バージョンv1.0.0 以降(v0.205〜0.299 はパブリックプレビュー、v0.18 以前はレガシ)A
default: true にできるターゲット数1 つだけA/P
databricks.yml の数ルートに 1 つだけA/P
バンドルの一意性名前 × ターゲット × デプロイ元 IDP
presets の優先順位個別リソース > presets > modeP
認証設定の評価順序バンドル設定 → 環境変数 → .databrickscfgA/P
1 ユーザーあたりの Git 資格情報最大 10 個(プロバイダーごとに既定 1 つ)A
ローカルブランチの残存期間リモート削除後も最大 30 日A
Git URL 許可リストの反映最大 15 分A
スパースチェックアウトが機能しない条件4 GB 超の Azure DevOps リポジトリA
標準 Git フォルダーの制限2 GB メモリ / 4 GB ディスクP
Git CLI アクセス自動付与の条件10,000 ファイル以下P
ライフサイクル 6 段階作成 → 開発 → 検証デプロイ実行 → 破棄A/P
OAuth U2M トークンの有効期間1 時間以内に期限切れA

18. ジョブの上限値

項目範囲
1 ワークスペースのタスク同時実行2,000(超過で 429 Too Many RequestsA
1 時間あたりのジョブ作成数10,000(run submit 含む)A
1 ワークスペースの保存ジョブ数10,000(保存パイプラインは別枠で 12,000)A
1 ジョブのタスク数最大 1,000A
ジョブパラメータの文字数10,000 文字(動的値使用時)A
既定の最大同時実行数1(超過分はスキップA
スケジュール実行間の最小間隔10 秒(cron の書き方に関係なく強制)A
絶対時間で毎時実行したいときのタイムゾーンUTC(DST のタイムゾーンだとスキップ/ずれが起きる)A

19. UDF の制限

項目範囲
pandas UDF の高速化行ごと Python UDF の最大 100 倍A/P
Arrow のバッチサイズspark.sql.execution.arrow.maxRecordsPerBatch 既定 1 万レコード/バッチP
サーバーレス PySpark UDF のメモリ上限1 GB/UDFP
性能順(速い → 遅い)組み込み関数 = SQL UDF > Scala UDF > pandas UDF > 行ごと Python UDFA/P
ブロードキャスト変数標準アクセスモード / サーバーレスの PySpark UDF は非対応P
ネットワークアクセスサーバーレス SQL ウェアハウスの Python UDF は既定で送信不可P

20. Delta Sharing / フェデレーション

項目範囲
共有識別子の形式<cloud>:<region>:<uuid>P
ベアラートークンの最大有効期間1 年P
資格情報ファイルのダウンロード回数1 回だけP
受信者が同時に保持できるトークン数最大 2(アクティブ+ローテーション中)P
WITH HISTORY の既定DBR 16.2 以降で WITH HISTORY、それ未満で WITHOUT HISTORY(スキーマ共有は常に WITH)P
共有で許可できる唯一の権限SELECTP
エグレス費用同一リージョン内は無料。クラウド/リージョン跨ぎで発生(Cloudflare R2 は無料P
既存トークンの即時失効--existing-token-expire-in-seconds 0P
Lakehouse フェデレーションの前提Databricks SQL / DBR 13.3 LTS 以降 / Unity Catalog のみ読み取り専用P

21. Free Edition の制限(学習環境)

項目
ワークスペース / メタストア1 アカウント = 1 ワークスペース / 1 メタストア
SQL ウェアハウス1 台・2X-Small 固定
ジョブの同時実行タスク最大 5(アカウントあたり)
パイプライン種別ごとにアクティブ 1 本
コンピュートサーバーレス専用(カスタム構成不可)
サーバーレスの最大実行時間7 日
サポートされないトリガーProcessingTime / ContinuousAvailableNow / Once のみ
使えないものSpark UI、RDD API、Scala / R、キャッシュ API、コンピュートポリシー、init スクリプト

詳細は ../06_hands-on/00-free-edition.md を参照。


直前 30 秒で見る「これだけは」トップ 12

  1. スキュー判定 = Max が 75 パーセンタイルより 50% 以上長い
  2. AQE 既定値 = ブロードキャスト 30MB / advisory 64MB / スキュー factor 5 かつ 256MB結合順序は変えない
  3. VACUUM = 既定保持 7 日、7 日以上推奨、ログは 30 日で VACUUM 管理外
  4. 液体クラスタリングキー = 最大 4、統計は先頭 32 列、パーティション/ZORDER と併用不可
  5. ファイルサイズ = <2.56TB → 256MB / >10TB → 1GB / 自動圧縮 true128MB、小ファイルは 8MB 以上
  6. パーティション = 1TB 未満は分割しない、分割は各 1GB 以上
  7. スキーマ推論 = 50GB または 1000 ファイル、JSON/CSV/XML はすべて文字列
  8. Delta シンク = update 非サポート(append/complete のみ)→ foreachBatch + MERGE
  9. foreachBatch = at-least-oncetxnAppId + txnVersionbatchId にバインド)
  10. 行フィルター/列マスク DBR = 標準 12.2 LTS+ / 専用 15.4 LTS+ / 書き込み 16.3+ / 12.2 未満は fail safe
  11. PSI = >= 0.2 で有意な母集団変化
  12. UDF 性能順 = 組み込み/SQL > Scala > pandas > 行ごと Python

関連ファイル

ファイル役割
glossary.md英日用語対訳集
../05_practice-questions/確認問題(数値を問う問題が多数)
../08_mock-exam/模擬試験(本番形式の通し練習)

⚠️ DBR のバージョン境界とプレビュー状況は更新されます。本ファイルは 2026-07 時点の公式記載に基づきます。受験直前に公式で再確認してください。