テーマ切替
数値・バージョン境界チートシート(直前 1 枚)
試験で「どの数値か」「どの DBR バージョンから使えるか」を問う問題は確実に出ます。教材に散在する数値をここに集約しました。 範囲: A = Associate 中心 / P = Professional 中心 / A/P = 両方。 用語そのものは glossary.md を参照してください。
使い方
- 右列(値)を隠して言えるか確認する
- 言えなかった行の教材の節に戻る
- 受験前日・当日にこのファイルだけを 2 周する
1. 試験スペック
| 項目 | Associate | Professional |
|---|---|---|
| 問題数 | 45 問 | 59 問(採点対象。未採点問題が加わることがある) |
| 制限時間 | 90 分 | 120 分 |
| 1 問あたり | 約 2 分 | 約 2 分 |
| 合格ライン | 70% 以上 | 70% 以上 |
| 費用 | 200 USD | 200 USD |
| 有効期限 | 2 年間 | 2 年間 |
Professional のドメイン配点(公式): ① コード開発 22% / ② コスト・性能 13% / ③ 変換・品質 10% / ④ 監視 10% / ⑤ セキュリティ 10% / ⑥ デバッグ・デプロイ 10% / ⑦ インジェスト 7% / ⑧ ガバナンス 7% / ⑨ モデリング 6% / ⑩ 共有・フェデレーション 5%
2. Delta Lake / テーブル
| 項目 | 値 | 範囲 |
|---|---|---|
| 既定のテーブル形式 | Delta Lake(特に指定しない限り全テーブル) | A |
| データスキップの統計収集列 | 既定で先頭 32 列 | A/P |
VACUUM 既定保持期間 | 7 日(delta.deletedFileRetentionDuration) | A/P |
VACUUM 推奨保持期間 | 7 日以上を強く推奨 | A/P |
| ログファイルの既定保持 | 30 日(VACUUM の管理外、チェックポイント後に非同期削除) | A/P |
VACUUM DRY RUN の一覧上限 | 最大 1000 件表示 | A |
VACUUM 推奨クラスター | ワーカー 1〜4(各 8 コア)で自動スケール + ドライバー 8〜32 コア | P |
VACUUM チューニング目安 | 10,000 ファイル超削除 or 30 分超ならドライバー/ワーカーを増やす | P |
| Iceberg テーブルの保持期間 | 7 日で固定 | A |
| Delta ライター/リーダーバージョン(液体クラスタリング) | ライター 7 / リーダー 3(ダウングレード不可) | A/P |
3. 液体クラスタリング
| 項目 | 値 | 範囲 |
|---|---|---|
| クラスタリングキーの最大数 | 4 | A/P |
| キーに使える列 | 統計が収集された列(既定で先頭 32 列) | A/P |
| キーを増やすと遅くなる境界 | 10 TB 未満のテーブルで単一列フィルターが遅くなりうる(4 キー < 2 キー) | P |
| キーにできない型 | 複合型そのもの(StructType / MapType / ArrayType)、配列/マップ要素 | P |
| キーにできる型 | Date, Timestamp, TimestampNTZ, String, Integer/Long/Short/Byte, Float/Double/Decimal、構造体フィールド(ドット表記・任意の深さ) | P |
| 書き込み時クラスタリングのしきい値(UC マネージド) | 1 キー 64 MB / 2 キー 256 MB / 3 キー 512 MB / 4 キー 1 GB | P |
| 書き込み時クラスタリングのしきい値(その他 Delta) | 1 キー 256 MB / 2 キー 1 GB / 3 キー 2 GB / 4 キー 4 GB | P |
| ストリーミングでのトリガー条件 | 直近 5 回のストリーミング更新の少なくとも 1 回がしきい値超過 | P |
更新/挿入が多いテーブルの OPTIMIZE 頻度 | 1〜2 時間ごとを推奨 | P |
OPTIMIZE の推奨実行開始頻度 | まず毎日、その後コスト/性能で調整 | P |
4. ファイルサイズ
| 項目 | 値 | 範囲 |
|---|---|---|
| テーブルサイズ別の自動チューニング(< 2.56 TB) | ターゲット 256 MB | P |
| (2.56 TB〜10 TB) | 256 MB → 1 GB へ線形に増加 | P |
| (> 10 TB) | ターゲット 1 GB | P |
自動圧縮 / 最適化された書き込みを true にした場合 | 128 MB 固定 | P |
| 最適化された書き込みが常に有効(オフ不可)な操作 | MERGE / サブクエリ付き UPDATE・DELETE | P |
| 「小さいファイル」の目安 | 8 MB を下回らないようにする(数万ファイルなら small files 問題) | P |
OPTIMIZE のスケジュール実行推奨 | 1 TB 超のテーブル | P |
5. パーティション設計
| 項目 | 値 | 範囲 |
|---|---|---|
| パーティション分割しない目安 | 1 TB 未満のテーブル | A/P |
| パーティション分割する条件 | 各パーティションが 1 GB 以上になる見込みの列 | A/P |
| 新規テーブルの推奨 | パーティションではなく液体クラスタリング | A/P |
6. AQE(アダプティブクエリ実行)
| プロパティ | 既定値 | 範囲 |
|---|---|---|
spark.databricks.optimizer.adaptive.enabled | true(既定で有効) | A/P |
spark.sql.shuffle.partitions | 200(auto で自動最適化シャッフル) | P |
spark.databricks.adaptive.autoBroadcastJoinThreshold | 30MB | P |
spark.sql.adaptive.coalescePartitions.enabled | true | P |
spark.sql.adaptive.advisoryPartitionSizeInBytes | 64MB | P |
spark.sql.adaptive.coalescePartitions.minPartitionSize | 1MB | P |
spark.sql.adaptive.coalescePartitions.minPartitionNum | クラスターコア数の 2 倍(非推奨設定) | P |
spark.sql.adaptive.skewJoin.enabled | true | P |
spark.sql.adaptive.skewJoin.skewedPartitionFactor | 5 | P |
spark.sql.adaptive.skewJoin.skewedPartitionThresholdInBytes | 256MB | P |
spark.databricks.adaptive.emptyRelationPropagation.enabled | true | P |
スキュー判定条件: 「サイズ > factor(5) × 中央値サイズ」かつ「サイズ > 256MB」の両方を満たすとき AQE の 4 機能: ①ソートマージ → ブロードキャストへ動的切替 ②パーティションの動的結合 ③スキュー結合の動的処理 ④空リレーションの検出・伝播 AQE がやらないこと: 結合順序の自動変更(動的結合並べ替え)は AQE の一部ではない
7. Spark UI 診断
| 項目 | 値 | 範囲 |
|---|---|---|
| スキュー判定 | タスク時間の Max が 75 パーセンタイルより 50% 以上長い | A/P |
| 健全なステージ | 75 パーセンタイルと Max がほぼ同じ | A/P |
| ジョブタイムラインのギャップ | 1 分以上の空白を探す(短い中断は正常) | P |
| 「多数の小さなジョブ」の目安 | 数秒以下の小さなジョブが大量、データ < 10 GB | A/P |
| タスク数が問題のサイン | タスクが 1 つだけ(並列化されていない) | P |
| 診断順序 | ①タイムライン → ②最長ステージ → ③スピル → ④スキュー → ⑤I/O 依存 → ⑥その他 | A/P |
| Executor 削除の 3 理由 | ①自動スケール(正常) ②スポットインスタンス損失 ③Executor OOM | P |
8. Auto Loader / インジェスト
| 項目 | 値 | 範囲 |
|---|---|---|
| スキーマ推論のサンプリング | 先頭 50 GB または 1000 ファイル(先に達した方) | A/P |
| JSON / CSV / XML の既定推論型 | すべて文字列(JSON の入れ子含む) | A/P |
| 型推論を有効にする | cloudFiles.inferColumnTypes=true | A/P |
| 既定のスキーマ進化モード(スキーマ未指定時) | addNewColumns | P |
| 既定のスキーマ進化モード(スキーマ指定時) | none | P |
cloudFiles.maxFilesPerTrigger | 既定 1000(ハード上限) | P |
cloudFiles.maxBytesPerTrigger | ソフト上限(未設定が既定) | P |
cloudFiles.maxFileAge | 最小 14 days、推奨は 90 日程度 | P |
| Auto Loader のスケール | 数十億ファイル、毎時数百万ファイルまで | A/P |
COPY INTO の FILES 上限 | 1000 ファイル(PATTERN と併用不可) | A |
COPY INTO の VALIDATE n ROWS | 50 未満だとプレビュー返却 | A |
Delta ストリーミングソースの maxFilesPerTrigger | 既定 1000 | P |
9. Structured Streaming
| 項目 | 値 | 範囲 |
|---|---|---|
| トリガー未設定時の挙動 | processingTime=0(数ミリ秒ごと)→ 予期しないクラウド課金 | P |
| 既定のレイテンシ目安(トリガー未指定) | 3〜5 秒 | P |
Trigger.Once の非推奨開始 | DBR 11.3 LTS 以降(→ AvailableNow を使う) | P |
| リアルタイムモードのレイテンシ | 1 秒未満、代表 〜300ms(パブリックプレビュー) | P |
Trigger.AvailableNow の最小 DBR | ファイルソース 9.1 LTS / Delta・Auto Loader・Kafka 10.4 LTS / Kinesis 13.1 | P |
| Delta シンクの出力モード | append と complete のみ(update は非サポート) | P |
| Kafka シンクの出力モード | 全モードサポート | P |
| 結合の出力モード | append のみ | P |
| ストリーム結合の状態ストアインスタンス | パーティションごとに 4 インスタンス | P |
| 複数ウォーターマークの既定ポリシー | グローバルに最小値(min) | P |
dropDuplicatesWithinWatermark の最小 DBR | 13.3 LTS 以降(ウォーターマーク指定が必須) | P |
| ソーステーブル保持と再実行 | VACUUM 既定 7 日 / logRetentionDuration 30 日以内に少なくとも 1 回実行が必要 | P |
10. Expectations / データ品質
| 項目 | 値 | 範囲 |
|---|---|---|
| 3 アクション | warn(既定・保持)/ drop(削除)/ fail(更新失敗・アトミックにロールバック) | A/P |
| メトリックが記録されないアクション | fail(更新が失敗するため) | A/P |
グループ適用(expect_all 系) | Python 限定 | A/P |
| 期待値をサポートするデータセット | ストリーミングテーブル / 具体化ビュー / 一時ビューのみ(シンクは非対応) | P |
| 制約句に使えないもの | カスタム Python 関数 / 外部サービス呼び出し / 他テーブル参照サブクエリ | A/P |
| 期待値名の一意性 | データセット内で一意(複数データセット間では再利用可) | A/P |
| 完全性の評価窓 | 過去 24 時間の書き込み行数 | P |
11. データ品質監視 / メトリック
| 項目 | 値 | 範囲 |
|---|---|---|
| メトリックテーブル名 | {table}_profile_metrics / {table}_drift_metrics | P |
| 分位点の配列 | 1000 分位点(中央値は quantiles[500]) | P |
| 頻出項目 | 上位 100 頻出(frequent_items) | P |
| 時系列/推論プロファイルの振り返り | 作成時刻から 30 日 | P |
| PSI の解釈 | < 0.1 有意な変化なし / < 0.2 中程度 / >= 0.2 有意な母集団変化 | P |
| カテゴリ列のドリフト指標 | カイ二乗検定 / TV 距離 / L∞距離 / JS 距離 | P |
| 数値列のドリフト指標 | KS 検定 / Wasserstein 距離 / PSI | P |
| ドリフト種別 | CONSECUTIVE(直前ウィンドウ)/ BASELINE(ベースラインテーブル提供時のみ) | P |
12. システムテーブル
| テーブル | 無料保持 | データ範囲 | 範囲 |
|---|---|---|---|
system.access.audit | 365 日 | WS レベル=リージョン / アカウントレベル=グローバル | P |
system.billing.usage | 365 日 | グローバル | P |
system.billing.list_prices | 不定 | グローバル | P |
system.lakeflow.jobs / job_tasks / job_run_timeline / job_task_run_timeline | 365 日 | リージョン | P |
system.compute.node_timeline | 90 日 | リージョン | P |
system.query.history | 365 日 | リージョン | P |
system.data_classification.results | 13 か月 | リージョン | P |
system.storage.predictive_optimization_operations_history | 180 日 | リージョン | P |
system.serving.endpoint_usage | 90 日 | リージョン | P |
system.access.table_lineage / column_lineage | 365 日(Catalog Explorer 表示は無期限) | リージョン | P |
その他の数値
- タイムラインの 1 行あたり最大スライス: 1 時間(
result_state/termination_codeは最終行のみ) - アカウントレベルイベント:
workspace_id = **0** - リネージ利用可能開始日: 2024 年 9 月 1 日以降にキャプチャされたもののみ
- ストリーミング利用時の設定:
skipChangeCommits = true
13. アラート / 通知
| 項目 | 値 | 範囲 |
|---|---|---|
| SQL アラートの状態 | OK / TRIGGERED / ERROR(UNKNOWN は廃止) | P |
| ワークスペースのアクティブ実行クォータ | 既定 250 同時実行(超過時はアラート実行がスキップ) | P |
| 通知イベント種別ごとのシステム宛先 | ジョブ/タスクごと最大 3 つ | P |
| ストリーミングバックログ通知の判定 | 10 分間の平均バックログ | P |
| ストリーミングバックログ通知のクールダウン | 送信後 30 分待って次を判断 | P |
| Email 宛先の文字数制限 | 1,300 文字 | P |
| タスクの既定再試行回数 | 3 回(「最後の再試行まで通知をミュート」の文脈) | P |
14. Unity Catalog / ガバナンス
| 項目 | 値 | 範囲 |
|---|---|---|
| メタストアの数 | リージョンごとに 1 つ | A/P |
| ネームスペースの階層数 | 3 階層(catalog.schema.object)。Hive は 2 階層 | A/P |
| 1 オブジェクト(テーブル/列)あたりのタグ上限 | 50 | P |
| 1 テーブルの全列合計の列タグ上限 | 1,000 | P |
| タグのキー/値の最大長 | 各 256 文字 | P |
| タグキーに使えない文字 | . , - = / :(先頭/末尾のスペースも不可) | P |
| タグキーの大文字小文字 | 区別する(Sales ≠ sales) | P |
| 1 コマンドでの複数列タグ付与 | 不可(列ごとに個別実行) | P |
ABAC の MATCH COLUMNS 上限 | 最大 3 つ | P |
| 権限継承が働かないレベル | メタストアレベル(CREATE CATALOG は子に継承されない) | A/P |
ALL PRIVILEGES に含まれないもの | MANAGE / EXTERNAL USE LOCATION / EXTERNAL USE SCHEMA | P |
| Unity Catalog 自動有効化の開始日 | 2023 年 11 月 9 日以降に作成されたワークスペース | A |
| リネージのシステムテーブル保持 | ローリング 1 年 | P |
15. セキュリティ(DBR バージョン境界が最重要)
| 項目 | 値 | 範囲 |
|---|---|---|
| 行フィルターの個数 | 1 テーブルに 1 つ | P |
| 列マスクの個数 | 1 列に 1 つ | P |
| 行フィルター/列マスク: 標準アクセスモード | DBR 12.2 LTS 以降 | P |
| 行フィルター/列マスク: 専用アクセスモード | DBR 15.4 LTS 以降(サーバーレス有効が前提) | P |
| 専用モードで読み取りのみの範囲 | DBR 15.4〜16.2 | P |
| 専用モードで書き込みに必要 | DBR 16.3 以降 | P |
| DBR 12.2 LTS 未満 | 非サポート=fail safe(アクセスしてもデータが返らない) | P |
| 動的ビュー: 専用アクセスモード | DBR 15.4 LTS 以降(15.3 以下は読み取り不可) | P |
| ABAC ポリシー作成 | DBR 16.4 以降 またはサーバーレス | P |
パーティション列ポリシーの DELETE/UPDATE/MERGE | DBR 17.2 以降 | P |
CURRENT_RECIPIENT()(共有の動的ビュー) | DBR 14.2 以降 | P |
| ANSI モードの推奨 | spark.sql.ansi.enabled = true(無効だとサイレント NULL 化で誤結果) | P |
16. その他の DBR バージョン境界(頻出)
| 機能 | 必要な DBR | 範囲 |
|---|---|---|
| パフォーマンス強化が既定で有効 | 10.4 LTS 以降 | A/P |
| ワークスペースファイルが既定で有効(バンドル前提) | 11.2 以降(11.3 LTS 以上を運用推奨) | A/P |
Trigger.Once の非推奨化 | 11.3 LTS 以降 | P |
StreamingQueryListener(Python/Scala) | 11.3 LTS 以降 | P |
| Delta 間ストリーミングの系列追跡 | 11.3 LTS 以降 | P |
WHEN NOT MATCHED BY SOURCE | 12.2 LTS 以降 | A/P |
UPDATE SET * EXCEPT (...) | 12.2 LTS 以降 | A |
ignoreChanges → skipChangeCommits へ置換 | 12.2 LTS | P |
| 予測的最適化の前提 | 12.2 LTS 以降(または SQL ウェアハウス) | P |
液体クラスタリングのクラスタリングトリガー(OPTIMIZE) | 13.3 LTS 以降 | P |
| ボリュームのサポート | 13.3 LTS 以降 | A |
| 行追跡の書き込み | 13.3 LTS 以降 | P |
dropDuplicatesWithinWatermark | 13.3 LTS 以降 | P |
| Lakeflow パイプラインの列系列追跡 | 13.3 LTS 以降 | P |
| Lakehouse フェデレーション | 13.3 LTS 以降 | P |
ALTER SHARE ADD SCHEMA | 13.3 LTS 以降 | P |
| スカラー Python UDF / pandas UDF が全アクセスモード対応 | 13.3 LTS 以降 | P |
DataFrameWriterV2 で clusterBy | 14.2 以降 | P |
| DataFrame / DeltaTable API で液体クラスタリング | 14.3 LTS 以降 | P |
| TimestampNTZ をクラスタリングキーに | 14.3 LTS 以降 | P |
| チェックポイント V2 が既定(液体クラスタリング作成時) | 14.3 LTS 以降 | P |
MERGE WITH SCHEMA EVOLUTION | 15.2 以降 | A/P |
StreamingQueryListener で UC 管理オブジェクトと対話 | 15.1 以降(標準アクセスモードの Scala は 16.1 以降) | P |
| 液体クラスタリング GA(Delta) | 15.4 LTS 以降 | A/P |
自動液体クラスタリング(CLUSTER BY AUTO) | 15.4 LTS 以降(UC マネージド Delta) | A/P |
SET TAG / UNSET TAG 構文 | 16.1 以降 | P |
複数一致の判定に WHEN MATCHED 条件も使う | 16.0 以降(15.4 LTS 以下は ON 条件のみ) | P |
OPTIMIZE FULL(強制再クラスタリング) | 16.0 以降(LTS は 16.4 LTS) | A/P |
VACUUM LITE / FULL モード | 16.1 以降 | A/P |
| 液体クラスタリング(Iceberg)パブリックプレビュー | 16.4 LTS 以降 | P |
| 構造化ストリーミング書き込みで液体クラスタリング有効テーブルを作成 | 16.4 LTS 以降 | P |
| 自動液体クラスタリングの Python API | 16.4 以降 | P |
大きなテーブルの OPTIMIZE 性能向上 | 17.3 LTS 以降推奨 | P |
| 自動変更データフィード(読み取り時計算) | DBR 18 以降(+ UC 登録・行追跡有効) | P |
deletedFileRetentionDuration で保持制御 | 18.0 以降(UC マネージドは 12.2 以降) | P |
システムテーブルの Trigger.AvailableNow 追いつき | 18.0 以降 | P |
| マネージド Iceberg v3 機能(自動液体クラスタリング含む) | 18.0 以降 | P |
予測的最適化のスキップ理由確認(... AS JSON) | 18 以降 | P |
ALTER TABLE ... REPLACE PARTITIONED BY WITH CLUSTER BY | 18.1 以降 | P |
OPTIMIZE FULL WHERE <predicate>(部分再クラスタ) | 18.1 以降 | P |
ソースの進化(queryEvolution.enableSourceEvolution) | 18.2 以降 | P |
17. CI/CD
| 項目 | 値 | 範囲 |
|---|---|---|
| バンドルに必要な Databricks CLI | v0.218.0 以降 | A/P |
| CLI の GA バージョン | v1.0.0 以降(v0.205〜0.299 はパブリックプレビュー、v0.18 以前はレガシ) | A |
default: true にできるターゲット数 | 1 つだけ | A/P |
databricks.yml の数 | ルートに 1 つだけ | A/P |
| バンドルの一意性 | 名前 × ターゲット × デプロイ元 ID | P |
| presets の優先順位 | 個別リソース > presets > mode | P |
| 認証設定の評価順序 | バンドル設定 → 環境変数 → .databrickscfg | A/P |
| 1 ユーザーあたりの Git 資格情報 | 最大 10 個(プロバイダーごとに既定 1 つ) | A |
| ローカルブランチの残存期間 | リモート削除後も最大 30 日 | A |
| Git URL 許可リストの反映 | 最大 15 分 | A |
| スパースチェックアウトが機能しない条件 | 4 GB 超の Azure DevOps リポジトリ | A |
| 標準 Git フォルダーの制限 | 2 GB メモリ / 4 GB ディスク | P |
| Git CLI アクセス自動付与の条件 | 10,000 ファイル以下 | P |
| ライフサイクル 6 段階 | 作成 → 開発 → 検証 → デプロイ → 実行 → 破棄 | A/P |
| OAuth U2M トークンの有効期間 | 1 時間以内に期限切れ | A |
18. ジョブの上限値
| 項目 | 値 | 範囲 |
|---|---|---|
| 1 ワークスペースのタスク同時実行 | 2,000(超過で 429 Too Many Requests) | A |
| 1 時間あたりのジョブ作成数 | 10,000(run submit 含む) | A |
| 1 ワークスペースの保存ジョブ数 | 10,000(保存パイプラインは別枠で 12,000) | A |
| 1 ジョブのタスク数 | 最大 1,000 | A |
| ジョブパラメータの文字数 | 10,000 文字(動的値使用時) | A |
| 既定の最大同時実行数 | 1(超過分はスキップ) | A |
| スケジュール実行間の最小間隔 | 10 秒(cron の書き方に関係なく強制) | A |
| 絶対時間で毎時実行したいときのタイムゾーン | UTC(DST のタイムゾーンだとスキップ/ずれが起きる) | A |
19. UDF の制限
| 項目 | 値 | 範囲 |
|---|---|---|
| pandas UDF の高速化 | 行ごと Python UDF の最大 100 倍 | A/P |
| Arrow のバッチサイズ | spark.sql.execution.arrow.maxRecordsPerBatch 既定 1 万レコード/バッチ | P |
| サーバーレス PySpark UDF のメモリ上限 | 1 GB/UDF | P |
| 性能順(速い → 遅い) | 組み込み関数 = SQL UDF > Scala UDF > pandas UDF > 行ごと Python UDF | A/P |
| ブロードキャスト変数 | 標準アクセスモード / サーバーレスの PySpark UDF は非対応 | P |
| ネットワークアクセス | サーバーレス SQL ウェアハウスの Python UDF は既定で送信不可 | P |
20. Delta Sharing / フェデレーション
| 項目 | 値 | 範囲 |
|---|---|---|
| 共有識別子の形式 | <cloud>:<region>:<uuid> | P |
| ベアラートークンの最大有効期間 | 1 年 | P |
| 資格情報ファイルのダウンロード回数 | 1 回だけ | P |
| 受信者が同時に保持できるトークン数 | 最大 2(アクティブ+ローテーション中) | P |
WITH HISTORY の既定 | DBR 16.2 以降で WITH HISTORY、それ未満で WITHOUT HISTORY(スキーマ共有は常に WITH) | P |
| 共有で許可できる唯一の権限 | SELECT | P |
| エグレス費用 | 同一リージョン内は無料。クラウド/リージョン跨ぎで発生(Cloudflare R2 は無料) | P |
| 既存トークンの即時失効 | --existing-token-expire-in-seconds 0 | P |
| Lakehouse フェデレーションの前提 | Databricks SQL / DBR 13.3 LTS 以降 / Unity Catalog のみ・読み取り専用 | P |
21. Free Edition の制限(学習環境)
| 項目 | 値 |
|---|---|
| ワークスペース / メタストア | 1 アカウント = 1 ワークスペース / 1 メタストア |
| SQL ウェアハウス | 1 台・2X-Small 固定 |
| ジョブの同時実行タスク | 最大 5(アカウントあたり) |
| パイプライン | 種別ごとにアクティブ 1 本 |
| コンピュート | サーバーレス専用(カスタム構成不可) |
| サーバーレスの最大実行時間 | 7 日 |
| サポートされないトリガー | ProcessingTime / Continuous(AvailableNow / Once のみ) |
| 使えないもの | Spark UI、RDD API、Scala / R、キャッシュ API、コンピュートポリシー、init スクリプト |
詳細は ../06_hands-on/00-free-edition.md を参照。
直前 30 秒で見る「これだけは」トップ 12
- スキュー判定 = Max が 75 パーセンタイルより 50% 以上長い
- AQE 既定値 = ブロードキャスト 30MB / advisory 64MB / スキュー factor 5 かつ 256MB、結合順序は変えない
- VACUUM = 既定保持 7 日、7 日以上推奨、ログは 30 日で VACUUM 管理外
- 液体クラスタリングキー = 最大 4、統計は先頭 32 列、パーティション/ZORDER と併用不可
- ファイルサイズ = <2.56TB → 256MB / >10TB → 1GB / 自動圧縮
trueは 128MB、小ファイルは 8MB 以上 - パーティション = 1TB 未満は分割しない、分割は各 1GB 以上
- スキーマ推論 = 50GB または 1000 ファイル、JSON/CSV/XML はすべて文字列
- Delta シンク = update 非サポート(append/complete のみ)→
foreachBatch+MERGE foreachBatch= at-least-once →txnAppId+txnVersion(batchIdにバインド)- 行フィルター/列マスク DBR = 標準 12.2 LTS+ / 専用 15.4 LTS+ / 書き込み 16.3+ / 12.2 未満は fail safe
- PSI = >= 0.2 で有意な母集団変化
- UDF 性能順 = 組み込み/SQL > Scala > pandas > 行ごと Python
関連ファイル
| ファイル | 役割 |
|---|---|
| glossary.md | 英日用語対訳集 |
| ../05_practice-questions/ | 確認問題(数値を問う問題が多数) |
| ../08_mock-exam/ | 模擬試験(本番形式の通し練習) |
⚠️ DBR のバージョン境界とプレビュー状況は更新されます。本ファイルは 2026-07 時点の公式記載に基づきます。受験直前に公式で再確認してください。