テーマ切替
英日用語対訳集(Associate / Professional 共通)
教材 17 ファイルに散在する用語集を 1 ファイルに統合したものです。試験は用語が英語で出るため(日本語受験でも選択肢に英語が混ざる)、日本語概念と英語表記をセットで覚えてください。 「範囲」列: A = Associate 中心 / P = Professional 中心 / A/P = 両方。 詳しい説明は各教材の用語集・詳細解説を参照してください(このファイルは直前確認用の一覧です)。
使い方
- 左から右に隠して日本語 → 英語を言えるか確認
- 右から左に隠して英語 → 何の機能か言えるか確認
- 詰まった用語は該当教材の節に戻る
- 数値・バージョン境界は cheatsheet-numbers.md を併用
1. プラットフォーム / アーキテクチャ
| 日本語 | English | 一言説明 | 範囲 |
|---|---|---|---|
| データインテリジェンスプラットフォーム | Data Intelligence Platform | Databricks プラットフォームの現行呼称 | A |
| データレイクハウス | Data Lakehouse | データレイク+データウェアハウスの利点を統合。単一の信頼できる情報源 | A |
| メダリオンアーキテクチャ | Medallion architecture | Bronze → Silver → Gold で段階的に品質を高める設計。別名マルチホップ | A/P |
| 単一の信頼できる情報源 | Single source of truth | レイクハウスが目指す状態 | A |
| アカウント | Account | 複数ワークスペースを含む 1 エンティティ | A |
| ワークスペース | Workspace | チームが資産にアクセスするクラウド上のデプロイ環境 | A |
| DBU(Databricks 単位) | Databricks Unit (DBU) | 処理能力の課金単位。総コスト = DBU + VM + ディスク + ネットワーク | A/P |
| 汎用クラスター | All-purpose compute | 対話型・共有・手動終了/再起動可 | A |
| ジョブクラスター | Job compute | ジョブ完了時に自動終了、再起動不可。非対話型に使う | A/P |
| プール | Pool | アイドルインスタンス群。起動/自動スケールを高速化。アイドル中は DBU 課金なし | P |
| SQL ウェアハウス | SQL warehouse | SQL 実行用コンピュート。クラシック / プロ / サーバーレス | A |
| サーバーレス | Serverless | Databricks がコンピュート層を管理。数秒起動・自動スケール。DBU に VM 込み | A/P |
| Databricks Runtime | Databricks Runtime (DBR) | クラスター上で動くコアコンポーネント群。Apache Spark を含む | A/P |
| 実行コンテキスト | Execution context | 各言語の REPL 環境の状態 | A |
| Photon | Photon | ネイティブのベクトル化クエリエンジン。SQL ウェアハウスで既定有効 | A/P |
| 標準アクセスモード | Standard access mode | 旧・共有アクセスモード(shared) | P |
| 専用アクセスモード | Dedicated access mode | 旧・シングルユーザーアクセスモード(single-user) | P |
| きめ細かいアクセス制御 | Fine-Grained Access Control (FGAC) | 行・列・値レベルの制御。専用モードではサーバーレス上で適用 | P |
| DBFS ルート | DBFS root | 既定の保存領域。非推奨(Unity Catalog を使う) | A |
| ボリューム | Volume | UC が管理する非表形式データの論理ストレージ。パスベースアクセス専用 | A/P |
2. Delta Lake
| 日本語 | English | 一言説明 | 範囲 |
|---|---|---|---|
| Delta Lake | Delta Lake | Parquet + トランザクションログ。Databricks の既定テーブル形式 | A/P |
| ACID トランザクション | ACID transactions | 原子性 / 一貫性 / 分離性 / 永続性 | A |
| 原子性 | Atomicity | 完全に成功するか完全に失敗するか | A |
| 一貫性 | Consistency | 同時操作がデータ状態をどう観察するかの保証 | A |
| 分離性 | Isolation | 同時操作が互いにどう競合し得るかの規定 | A |
| 永続性 | Durability | コミットされた変更は永続的 | A |
| トランザクションログ | Transaction log / Delta log (_delta_log) | 全変更の記録。コミットの原子性・バージョン管理・並行制御の基盤 | A |
| 楽観的並行性制御 | Optimistic Concurrency Control | 読み取り → 書き込み → 検証とコミットの 3 段階。ロックなし・デッドロックなし | A |
| 同時変更例外 | Concurrent modification exception | 競合検出時に書き込みが失敗する例外 | A |
| 書き込みシリアル化可能分離 | Write serializable isolation | 書き込みの既定分離レベル | A/P |
| スナップショット分離 | Snapshot isolation | 読み取りの既定分離レベル | A/P |
| タイムトラベル | Time travel | 過去バージョンをクエリ(VERSION AS OF / TIMESTAMP AS OF) | A/P |
| スキーマ適用 | Schema enforcement | 書き込み時にスキーマを検証し要件外を弾く | A/P |
| スキーマ進化 | Schema evolution | データを書き換えずにスキーマを変更(列追加など) | A/P |
| 列マッピング | Column mapping | データを書き換えずに列の名前変更・削除 | P |
| 生成列 | Generated column | 関数で列値を自動生成。マスク対象列にできない制約あり | P |
| 削除ベクトル | Deletion vectors | 行の論理削除をメタデータで記録。行レベル並行性の前提 | P |
| 行レベル並行性 | Row-level concurrency | 同一テーブルへの同時書き込みの競合を減らす | P |
| ディープクローン | Deep clone | 定義+データの完全独立コピー | A |
| 浅いクローン | Shallow clone | 定義のみコピーし初期データは元を参照 | A |
| 変更データフィード | Change Data Feed (CDF) | バージョン間の行レベル変更を追跡 | P |
| アップサート | Upsert | 一致は更新、なければ挿入。MERGE INTO で実現 | A/P |
| 複数一致 | Multiple matches | ソース複数行が同一ターゲット行に一致 → 失敗(無条件 DELETE は例外) | A/P |
| 冪等性 | Idempotency | 何度実行しても結果が変わらない性質 | A/P |
3. Spark / PySpark / DataFrame
| 日本語 | English | 一言説明 | 範囲 |
|---|---|---|---|
| Apache Spark | Apache Spark | 統合分析エンジン。Databricks の基盤 | A/P |
| PySpark | PySpark | Python から Spark を操作する API | A/P |
| データフレーム | DataFrame | 名前付き列の 2 次元分散データ構造。RDD 上の抽象化 | A/P |
| RDD | Resilient Distributed Dataset | DataFrame の基盤となる低レベル分散抽象化 | P |
| SparkSession | SparkSession | Spark 機能へのエントリポイント(spark) | A/P |
| 変換 | Transformation | DataFrame を返す操作。遅延評価 | A/P |
| アクション | Action | 計算をトリガーし値を返す操作(count / show / write / collect) | A/P |
| 遅延評価 | Lazy evaluation | アクションが呼ばれるまで変換を実行しない | A/P |
| 即時実行 | Eager execution | pandas のモデル。定義時点で即実行 | P |
| 不変性 | Immutability | 変換は元を変更せず新しい DataFrame を返す | A/P |
| 実行計画 / 物理プラン | Execution plan / Physical plan | Catalyst が生成する最も効率的な実行手順 | P |
| 狭い変換 | Narrow transformation | 各出力パーティションが単一入力に依存。select / filter / withColumn | P |
| 広い変換 | Wide transformation | 複数入力に依存。groupBy / join / orderBy / distinct。シャッフルを伴う | P |
| シャッフル | Shuffle | パーティション間のデータ再分配。ステージ境界を作る | A/P |
| ジョブ / ステージ / タスク | Job / Stage / Task | アクション 1 回 = ジョブ / シャッフル境界で区切る = ステージ / 1 パーティション = タスク | A/P |
| ドライバー | Driver | Spark アプリを統括しスケジューリングするプロセス | A/P |
| Executor / ワーカー | Executor / Worker | タスクを実行する計算プロセス。ワーカー 1 台 = Executor 1 つ | A/P |
| Catalyst オプティマイザ | Catalyst optimizer | 統合された計画・最適化エンジン。言語間で性能差がほぼない理由 | P |
| Spark Connect | Spark Connect | サーバーレスでサポートされる API 群(RDD API は非サポート) | P |
| 一時ビュー | Temporary view | createOrReplaceTempView。セッション限定、言語間でデータ共有 | A/P |
| グローバル一時ビュー | Global temporary view | global_temp スキーマに関連付く一時ビュー | A |
| マジックコマンド | Magic command | %python / %sql / %scala / %r / %md | A |
4. ウィンドウ関数(Professional ① の中核)
| 日本語 | English | 一言説明 | 範囲 |
|---|---|---|---|
| ウィンドウ関数 | Window function | 行のグループに基づき各行の値を計算。行数を減らさない | P |
| OVER 句 | OVER clause | ウィンドウ仕様を関数に関連付ける | P |
| パーティション分割 | PARTITION BY | 関数が作用する行グループを定義。省略時は全行が 1 パーティション | P |
| 並べ替え | ORDER BY | パーティション内の行順。ランキング関数・RANGE フレームに必須 | P |
| ウィンドウフレーム | Window frame | 集計/分析関数が作用するスライディングサブセット | P |
| ROWS フレーム | ROWS frame | 物理的な行数で境界指定。タイ行も個別カウント | P |
| RANGE フレーム | RANGE frame | ORDER BY 値からの値のオフセット。同値行をまとめる | P |
| ランキング関数 | Ranking function | ROW_NUMBER / RANK / DENSE_RANK / NTILE / PERCENT_RANK。ORDER BY 必須・フレーム不可 | P |
| 分析関数 | Analytic function | LAG / LEAD / FIRST / LAST / NTH_VALUE / CUME_DIST | P |
| 集計ウィンドウ関数 | Aggregate window function | SUM / AVG / COUNT / MIN / MAX。フレーム指定可 | P |
| 累積和 | Running total | ROWS BETWEEN UNBOUNDED PRECEDING AND CURRENT ROW | P |
| 境界(先頭から) | UNBOUNDED PRECEDING | パーティションの先頭から | P |
| 境界(末尾まで) | UNBOUNDED FOLLOWING | パーティションの末尾まで | P |
5. UDF(ユーザー定義関数)
| 日本語 | English | 一言説明 | 範囲 |
|---|---|---|---|
| ユーザー定義関数 | User-Defined Function (UDF) | 組み込みで表現困難なカスタムロジック | A/P |
| スカラー UDF | Scalar UDF | 1 行 → 1 値 | A/P |
| バッチスカラー UDF | Batch scalar UDF | 1:1 を維持しつつ行をバッチ処理。バッチ間で状態保持可 | P |
| pandas UDF(ベクトル化 UDF) | pandas UDF / Vectorized UDF | Arrow で転送し pandas で処理。Python UDF の最大 100 倍高速 | A/P |
| UDTF | User-Defined Table Function | 1 行 → 複数行(複数列) | A/P |
| UDAF | User-Defined Aggregate Function | 複数行 → 1 集計値。セッションスコープ限定 | A/P |
| Apache Arrow | Apache Arrow | 言語をまたぐ列指向インメモリ形式。シリアライズコストを削減 | A/P |
| シリアライズのオーバーヘッド | Serialization overhead | JVM ⇔ Python 間のデータ移動コスト。Python UDF が遅い主因 | A/P |
| Unity Catalog 管理 UDF | Unity Catalog-governed UDF | UC に永続化。権限管理・共有・検出可。SQL/Python/Scala/Java | P |
| セッションスコープ UDF | Session-scoped UDF | 現在の SparkSession 限定。SQL/Python/Scala | P |
| 高階関数 | Higher-order function | 配列にラムダを適用。transform / filter / exists / forall / aggregate / zip_with | P |
| ラムダ関数(匿名関数) | Lambda / Anonymous function | x -> expr、2 引数は (acc, x) -> expr | P |
6. 複雑型 / 半構造化データ
| 日本語 | English | 一言説明 | 範囲 |
|---|---|---|---|
| 構造体 | struct | 名前付きフィールドのネストしたレコード。col.field でアクセス | P |
| 配列 | array | 同型要素の順序付きコレクション | P |
| マップ | map | キー・値ペア | P |
| explode | explode | 各要素を個別の行に展開。空/NULL は行が消える | P |
| explode_outer | explode_outer | 空/NULL でも NULL 行を保持 | P |
| posexplode | posexplode | 要素+位置(インデックス)を返す | P |
| inline | inline | 構造体配列を複数列に展開 | P |
| collect_list / collect_set | collect_list / collect_set | 行を配列に集約(explode の逆) | P |
| バリアント型 | VARIANT | 半構造化データ用の型。スキーマ/型変更に強い | A/P |
| レスキューされたデータ列 | Rescued data column (_rescued_data) | スキーマ不一致(欠落/型/大小文字)データを削除せず退避 | A/P |
7. データインジェスト / Auto Loader
| 日本語 | English | 一言説明 | 範囲 |
|---|---|---|---|
| データインジェスト | Data ingestion | 外部ソースから Lakehouse へ取り込む工程 | A/P |
| 自動ローダー | Auto Loader | 新規ファイルを増分・効率的に処理。cloudFiles ソース | A/P |
| cloudFiles | cloudFiles | Auto Loader の Structured Streaming ソース名 | A/P |
| ディレクトリ一覧モード | Directory listing mode | LIST API で列挙。既定。ファイル数が多いとコスト増 | A/P |
| ファイル通知モード | File notification mode | クラウドの通知サービス/キューを使う。低コスト・低レイテンシで推奨 | A/P |
| スキーマの場所 | Schema location (cloudFiles.schemaLocation) | 推論スキーマの変遷を保存。スキーマ進化に必須 | A/P |
| スキーマヒント | Schema hints (cloudFiles.schemaHints) | 既知の型情報を明示指定してオーバーライド | A/P |
| スキーマ進化モード | cloudFiles.schemaEvolutionMode | addNewColumns(既定)/ addNewColumnsWithTypeWidening / rescue / failOnNewColumns / none | A/P |
| 不明フィールド例外 | UnknownFieldException | 新列検出時にストリームを停止させる例外。再起動で続行 | P |
| バックフィル | Backfill | 既存(過去)ファイルの一括取り込み。非同期実行可 | A/P |
| RocksDB | RocksDB | チェックポイント内のキー/値ストア。処理済みファイルを追跡 | A/P |
| COPY INTO | COPY INTO | SQL でファイルを Delta へ冪等・増分ロード。既読はスキップ | A/P |
| フォーマットオプション | FORMAT_OPTIONS | リーダー(DataFrameReader)に渡すオプション | A |
| コピーオプション | COPY_OPTIONS | COPY INTO の動作制御(force / mergeSchema) | A |
| 検証モード | VALIDATE | 書き込まずに解析・スキーマ・制約を検証 | A |
| read_files | read_files() | SQL のテーブル値関数。STREAM read_files(...) で Auto Loader | A/P |
| ストリーミングテーブル | Streaming table | 追加専用ソースを増分・冪等に取り込む。CREATE STREAMING TABLE | A/P |
| Lakeflow Connect | Lakeflow Connect | インジェスト製品群(標準+マネージドコネクタ) | P |
| マネージドコネクタ | Managed connectors | ソース別フルマネージド。CDC・自動スキーマ進化を内包 | P |
| 厳密グロッバー | Strict globber (cloudFiles.useStrictGlobber) | 他の Spark ファイルソースと同じ glob 動作にする | A |
8. Structured Streaming
| 日本語 | English | 一言説明 | 範囲 |
|---|---|---|---|
| 構造化ストリーミング | Structured Streaming | バッチと同じ API で増分処理。exactly-once を保証 | A/P |
| 無制限テーブル | Unbounded table | 行が継続追記される入力テーブルという概念モデル | P |
| チェックポイント | Checkpoint (checkpointLocation) | 処理状態・進行状況を保存。クエリごとに別の場所が必須 | A/P |
| 先書きログ | Write-Ahead Log (WAL) | チェックポイントと連携して処理を保証 | P |
| オフセット | Offsets | 各マイクロバッチで処理するソース位置 | P |
| コミット | Commits | どのマイクロバッチがシンクにコミットされたか。exactly-once の要 | P |
| 状態 | State | ステートフルクエリの演算子・状態スキーマ・状態ストア内容 | P |
| メタデータ | Metadata | 一意のクエリ ID | P |
| 厳密に 1 回 | Exactly-once | 障害があっても各レコードが 1 回だけ反映 | A/P |
| 少なくとも 1 回 | At-least-once | 重複の可能性がある配信保証。foreachBatch はこれのみ | P |
| 冪等シンク | Idempotent sink | Delta では txnAppId + txnVersion(batchId にバインド) | P |
| トリガー | Trigger | 新データをチェックする頻度・方式 | A/P |
| Trigger.ProcessingTime | Trigger.ProcessingTime | 固定間隔マイクロバッチ | P |
| Trigger.AvailableNow | Trigger.AvailableNow | 起動時点の全データを増分バッチ処理して停止。スケジュール実行に推奨 | A/P |
| Trigger.Once | Trigger.Once | DBR 11.3 LTS 以降で非推奨 → AvailableNow を使う | P |
| リアルタイムモード | Real-time mode | 超低レイテンシ(〜300ms)。.trigger(realTime='...') | P |
| 出力モード | Output mode | append(既定)/ update / complete | P |
| 追加モード | Append mode | 将来変更されない行のみ出力。結合はこれのみ | P |
| 更新モード | Update mode | トリガー中に変更された全行を出力。Delta は非サポート | P |
| 完全モード | Complete mode | 集計のみ。全結果行を毎回出力。データ増大で性能低下 | P |
| foreachBatch | foreachBatch | 各マイクロバッチの DataFrame にバッチ関数を適用。MERGE に必須 | P |
| foreach | foreach | 行単位のカスタム書き込み。連続処理モードで動く | P |
| ウォーターマーク | Watermark | 遅延データを待つ閾値。古い状態を削除してメモリを制御 | A/P |
| ステートフル処理 | Stateful processing | 集計・ストリーム間結合・重複除去・transformWithState | P |
| ステートレス処理 | Stateless processing | 状態を持たない。全出力モードで同一挙動 | P |
| タンブリングウィンドウ | Tumbling window | 重複しない固定サイズ。各行は 1 ウィンドウ | P |
| スライディングウィンドウ | Sliding window | 重複可能な固定サイズ。1 行が複数ウィンドウに属す | P |
| セッションウィンドウ | Session window | 可変サイズ。ギャップ期間の無入力で閉じる | P |
| 重複除去 | Deduplication | dropDuplicatesWithinWatermark()(DBR 13.3 LTS+、ウォーターマーク必須) | P |
| 変更コミットのスキップ | skipChangeCommits | Delta ソースの更新/削除を無視し追加のみ処理。新規ワークロードで推奨 | P |
| バックプレッシャー / バックログ | Backpressure / Backlog | 入力レート > 処理レートで未処理データが溜まる状態 | P |
| StreamingQueryListener | StreamingQueryListener | 進捗イベントを外部へ push。DBR 11.3 LTS 以降 | P |
| StreamingQueryProgress | StreamingQueryProgress | 各マイクロバッチのメトリクス | P |
| 監視可能メトリック | Observable metrics (df.observe) | 任意の名前付き集計を定義し observedMetrics から取得 | P |
9. Lakeflow(Jobs / Pipelines / Expectations)
| 日本語 | English | 一言説明 | 範囲 |
|---|---|---|---|
| Lakeflow ジョブ | Lakeflow Jobs | 旧 Databricks Workflows / Jobs。オーケストレーション | A/P |
| ジョブ | Job | 調整・スケジュール・実行の主リソース | A/P |
| タスク | Task | ジョブ内の個々の作業単位 | A/P |
| 依存関係 | Dependency | タスク間の実行順序 | A |
| 有向非巡回グラフ | DAG (Directed Acyclic Graph) | 依存関係の視覚表現 | A/P |
| Quartz cron 構文 | Quartz cron syntax | 詳細スケジュールの cron 記法 | A/P |
| ファイル到着トリガー | File arrival trigger | UC の場所に新ファイルが届いたら起動 | A |
| テーブル更新トリガー | Table update trigger | ソーステーブル更新で起動 | A |
| 継続的トリガー | Continuous | ジョブを常時実行。ストリームのトリガー間隔ではない | A/P |
| 修復して再実行 | Repair run | 失敗・スキップしたタスクのサブセットのみを再実行 | A |
| 最大同時実行数 | Max concurrent runs | 既定 1。超過分はスキップ(キュー待ちではない) | A |
| ヘルスルール | Health rules | 期間・ストリーミングバックログのしきい値 | P |
| Lakeflow 宣言型パイプライン | Lakeflow Declarative Pipelines | 旧 Delta Live Tables (DLT)。宣言的 ETL | A/P |
| Spark 宣言型パイプライン | Spark Declarative Pipelines (SDP) | Lakeflow パイプラインの基盤 | A |
| マテリアライズドビュー | Materialized view | クエリ結果を実体化。REFRESH で更新 | A/P |
| パイプライングラフ | Pipeline graph | コードから自動生成される依存 DAG | A |
| 期待値 | Expectations | 通過レコードに SQL ブール制約で品質チェック | A/P |
| 保持(警告) | expect(warn、既定) | 違反も書き込み、合否件数を記録 | A/P |
| 削除 | expect_or_drop(drop) | 違反を書き込み前に削除、削除件数を記録 | A/P |
| 失敗 | expect_or_fail(fail) | 更新を失敗させアトミックにロールバック。メトリック記録なし | A/P |
| 違反時アクション句 | ON VIOLATION | DROP ROW または FAIL UPDATE。省略時は warn | A/P |
| 一括指定 | expect_all / _or_drop / _or_fail | 辞書でまとめて集合アクション。Python 限定 | A/P |
| 隔離 | Quarantine | is_quarantined フラグ列で有効/無効を分離。データを失わない | P |
| 検証テーブル | Validation table | 行数一致・PK 一意性等を expect_or_fail で検証。オーケストレーションではない | P |
| 探索フォルダー | explorations | アドホック分析用。既定でパイプライン更新に含まれない | A |
10. データモデリング(SCD / CDC)
| 日本語 | English | 一言説明 | 範囲 |
|---|---|---|---|
| 変更データキャプチャ | Change Data Capture (CDC) | DB を「一連の変更」として扱うパターン | P |
| CDC フィード | CDC feed | 操作種別+データ値+シーケンス番号を持つ変更ストリーム | P |
| スナップショット | Snapshot | 特定時点のテーブル全行。レコードレベルの変更は持たない | P |
| 緩やかに変化するディメンション | Slowly Changing Dimension (SCD) | 上流変更を分析テーブルに適用・モデル化する方式 | A/P |
| SCD Type 1 | SCD Type 1 | 上書き。最新バージョンのみ。履歴なし | A/P |
| SCD Type 2 | SCD Type 2 | 各バージョンを別行で保持。アクティブ行は __END_AT = NULL | A/P |
| AUTO CDC | AUTO CDC | 旧 APPLY CHANGES(構文は同一)。SCD 1/2 を自動計算 | P |
| AUTO CDC FROM SNAPSHOT | AUTO CDC FROM SNAPSHOT | 連続スナップショットを比較して合成変更フィードを生成。Python のみ | P |
| シーケンス列 | Sequence column (SEQUENCE BY) | 単調増加・並べ替え可能型・NULL 不可。順序外イベントを正しく処理 | P |
| 有効期間列 | __START_AT / __END_AT | SCD2 の各バージョンの有効期間。シーケンス値が伝播 | P |
| 履歴追跡列の限定 | TRACK HISTORY ON ... EXCEPT | 対象外列の変更は新履歴を作らず上書き | P |
| 初期ハイドレーション | Initial hydration | 既存テーブル全体を一度だけ読み込む(ワンスフロー once) | P |
| バイテンポラル追跡 | Bitemporal tracking(ベータ) | 業務時間+システム時間の 2 軸。__SYSTEM_START_AT / __SYSTEM_END_AT | P |
| 変更種別列 | _change_type | insert / update_preimage / update_postimage / delete | P |
| コミットバージョン列 | _commit_version / _commit_timestamp | 変更が含まれるバージョン / コミット時刻 | P |
| ファクト / ディメンション | Fact / Dimension | 測定値の中心テーブル / 分析軸 | A/P |
| スタースキーマ | Star schema | 中央のファクトを複数ディメンションが囲む次元モデル。Gold 層 | A/P |
| サロゲートキー | Surrogate key | 業務的意味を持たない安定した代理キー。CDC が可能にする | P |
| 非加法スキーマ変更 | Non-additive schema change | 列の名称変更・削除・型変更・NULL 許容変更。CDF で跨げない | P |
11. 最適化 / コスト
| 日本語 | English | 一言説明 | 範囲 |
|---|---|---|---|
| OPTIMIZE | OPTIMIZE | データファイルを書き換えレイアウトを改善 | A/P |
| ビンパッキング | Bin-packing | 小ファイルを均等サイズに結合。べき等 | A/P |
| 小さなファイル問題 | Small files problem | ファイルごとのオーバーヘッドでクエリが遅くなる | A/P |
| Z オーダー | Z-ORDER (ZORDER BY) | 液体クラスタリングのない Delta テーブルの多次元クラスタリング | A/P |
| 液体クラスタリング | Liquid clustering (CLUSTER BY) | パーティションと ZORDER を置き換え。書き換えなしでキー再定義 | A/P |
| 自動液体クラスタリング | Automatic liquid clustering (CLUSTER BY AUTO) | クエリ履歴からキーを自動選択。UC マネージド+予測的最適化が必要 | A/P |
| クラスタリングキー | Clustering key | データを整理する基準列。最大 4 | A/P |
| 強制再クラスタリング | OPTIMIZE FULL | 全レコードを再クラスタリング。初回有効化/キー変更時に実行 | A/P |
| 予測的最適化 | Predictive optimization | UC マネージドに OPTIMIZE / VACUUM / ANALYZE を自動実行。ZORDER は実行しない | A/P |
| VACUUM | VACUUM | 参照されない未使用データファイルを物理削除 | A/P |
| 保持期間 | Retention duration (delta.deletedFileRetentionDuration) | VACUUM が保持する期間 | A/P |
| データスキップ | Data skipping | min/max 統計で不要ファイルを読み飛ばす | A/P |
| 動的ファイルプルーニング | Dynamic File Pruning (DFP) | 述語に一致しないファイル/ディレクトリをスキップ | A/P |
| 低シャッフルマージ | Low shuffle merge | MERGE が書き換えるファイル数を減らす | P |
| 最適化された書き込み | Optimized writes | 書き込み前にシャッフルしてファイルサイズを整える | A/P |
| 自動圧縮 | Auto compaction | 書き込み後に同期的に小ファイルを結合 | A/P |
| データスキュー | Data skew | 特定キーに偏り一部タスクだけ極端に長時間化 | A/P |
| スピル | Spill | メモリ不足でメモリ→ディスクへ退避。シャッフル中に多発 | A/P |
| 概要メトリック | Summary metrics | ステージページのタスク指標(最小/25/中央値/75/最大) | A/P |
| アダプティブクエリ実行 | Adaptive Query Execution (AQE) | 実行時統計でクエリを再最適化。既定有効 | A/P |
| ブロードキャスト結合 | Broadcast (hash) join | 小テーブルを全 Executor に配布しシャッフルを回避 | A/P |
| コストベースオプティマイザ | Cost-Based Optimizer (CBO) | 統計(ANALYZE TABLE)で結合種別・順序を最適化 | A/P |
| ディスクキャッシュ | Disk cache | 旧 Delta キャッシュ。ローカル SSD に Parquet のコピー | A/P |
| クエリ結果キャッシュ | Query result cache | SQL ウェアハウスのクラスター単位。決定論的クエリで効く | A/P |
| Spark キャッシュ | Spark cache (.persist()) | 原則避ける(誤用でメモリを食い遅くなる) | A/P |
| デカルト結合 | Cartesian / Nested loop join | 結合条件のない総当たり。非常に高コスト | P |
| 分解結合 | Exploding join | 入る行数より出る行数が明らかに多い | P |
| 範囲結合の最適化 | Range join optimization | 区間の重なり条件。手動チューニングが必要 | P |
| 予測 I/O | Predictive I/O | Bloom フィルター(非推奨)の代替 | P |
| コンピュート最適化 | Compute-optimized | CPU 集約。OPTIMIZE / VACUUM / ストリーミング向け | P |
| メモリ最適化 | Memory-optimized | シャッフル/スピルが多い ML 向け | P |
| ストレージ最適化 | Storage-optimized | キャッシュの恩恵が大きいアドホック分析向け | P |
| 自動スケーリング | Autoscaling | 負荷に応じワーカーを動的増減 | A/P |
| 自動終了 | Auto termination | 指定アイドル時間後に自動停止 | A/P |
| スポットインスタンス | Spot instance | 余剰 VM を安価に利用。中断リスクあり。ドライバーはオンデマンド | P |
| コスト配分 | Cost allocation | タグ付けでチーム/プロジェクトに帰属。遡及不可 | P |
| 垂直/水平スケーリング | Vertical / Horizontal scaling | 1 台を大きく / ノードを増やす | P |
| 線形スケーラビリティ | Linear scalability | リソースとスループットが線形。シャッフルがあると崩れる | P |
12. Unity Catalog / ガバナンス
| 日本語 | English | 一言説明 | 範囲 |
|---|---|---|---|
| Unity Catalog | Unity Catalog | データと AI の統合ガバナンスレイヤー | A/P |
| メタストア | Metastore | 最上位。リージョンごとに 1 つ。データ分離の既定単位ではない | A/P |
| カタログ | Catalog | 3 階層の第 1 層。データ分離の主要単位 | A/P |
| スキーマ(データベース) | Schema (Database) | 第 2 層 | A/P |
| 3 階層ネームスペース | Three-level namespace | catalog.schema.object。Hive の 2 階層と対比 | A/P |
| セキュリティ保護可能オブジェクト | Securable object | 権限を付与できる対象の総称 | A/P |
| プリンシパル | Principal | ユーザー / グループ / サービスプリンシパル | A/P |
| マネージドテーブル/ボリューム | Managed table / volume | ガバナンス+ストレージのライフサイクル両方を UC が管理。推奨 | A/P |
| 外部テーブル/ボリューム | External table / volume | ガバナンスのみ UC が管理。DROP でデータは残る | A/P |
| マネージドストレージの場所 | Managed storage location | マネージド資産の既定格納先。最下位の設定が優先 | A/P |
| ストレージ資格情報 | Storage credential | クラウドストレージへの認証情報 | A/P |
| 外部ロケーション | External location | クラウドパス + ストレージ資格情報の組み合わせ | A/P |
| 使用特権 | Usage privileges | USE CATALOG / USE SCHEMA。それ自体ではデータにアクセスできない前提条件 | A/P |
| 権限継承 | Privilege inheritance | カタログ/スキーマの権限が子に自動適用。メタストアレベルは継承されない | A/P |
| BROWSE 特権 | BROWSE | 使用特権なしでメタデータ検出・アクセス要求。All account users に付与推奨 | P |
| MANAGE 特権 | MANAGE | 所有者でなくても権限管理・譲渡・削除可。ALL PRIVILEGES に含まれない | P |
| 所有権 | Ownership | 全権限+付与+譲渡の権利。運用オブジェクトはグループに割り当てる | A/P |
| データリネージ(系列) | Data lineage | 列レベルまで自動追跡。全ワークスペースで集約 | A/P |
| 列レベル系列 | Column-level lineage | 列単位の派生関係。テーブル名参照時のみ(パス参照は不可) | P |
| マスクされたノード | masked node | 権限のないダウンストリームの表示 | P |
| 影響分析 / 根本原因調査 | Impact analysis / Root cause analysis | 変更前の依存特定 / 異常から上流をトレース | P |
| 外部リネージ | External lineage | 外部メタデータオブジェクトで Databricks 外へ拡張 | P |
| タグ | Tag | 整理・分類のキー(+値)。平文で保存。ABAC の属性 | A/P |
| 管理タグ | Governed tag | 許可キー/値と割り当て可能者を制御。ASSIGN 特権が必要 | P |
| システムタグ | System tag | Databricks 事前定義。キー/値は変更不可 | P |
| システムテーブル | System tables | system カタログ。読み取り専用・リアルタイム監視不可 | P |
| 情報スキーマ | Information schema | system.information_schema。他と動作が異なる | P |
| 外部カタログ | Foreign catalog | Lakehouse フェデレーション専用。読み取り専用 | P |
| ワークスペースカタログバインド | Workspace-catalog binding | カタログアクセスをワークスペース境界に制限 | P |
| 既定のカタログ | Default catalog | カタログ名省略時に使われる | A/P |
| 予約カタログ | __databricks_internal | 内部状態格納用。照会・変更・削除してはならない | P |
| SCIM | SCIM | IdP からアカウントへの ID プロビジョニング。アカウントレベル推奨 | P |
13. セキュリティ / コンプライアンス
| 日本語 | English | 一言説明 | 範囲 |
|---|---|---|---|
| 行フィルター | Row filter | FALSE を返した行を除外する SQL UDF。1 テーブルに 1 つ | P |
| 列マスク | Column mask | 元の値かマスク値を返す SQL UDF。1 列に 1 つ。戻り値型は列型と一致/キャスト可 | P |
| 行レベルセキュリティ | Row-Level Security (RLS) | 表示できる行を制限する概念 | P |
| 動的ビュー | Dynamic view | 実行ユーザー/グループに応じて表示内容を変える UC ビュー | P |
| ABAC | Attribute-Based Access Control | 管理タグに基づき行フィルター/列マスクを一元適用 | P |
| ポリシー | Policy | CREATE POLICY。カタログ/スキーマ/テーブルにアタッチ | P |
| タグ条件 | has_tag / has_tag_value | ポリシー適用対象を決めるブール式 | P |
| 一致列 | MATCH COLUMNS | 対象列を識別。最大 3 つ | P |
| 除外プリンシパル | EXCEPT | ポリシーから除外。完全なデータを見られる | P |
| グループ判定(UC 推奨) | is_account_group_member() | アカウントレベルグループのメンバー判定。UC で推奨 | P |
| グループ判定(Hive 互換) | is_member() | アカウントレベルを評価しない。UC では使わない | P |
| 呼び出し元ユーザー | session_user() / current_user() | 現在のユーザーのメールアドレス | P |
| 定義者権限 | Definer's rights | フィルターは基本これで実行(session_user() 等は例外的に呼び出し元) | P |
| マッピングテーブル | Mapping table / ACL | 誰がどの行にアクセスできるかをエンコードしたテーブル | P |
| マスキング | Masking | 機密値を REDACTED 等に置換 | P |
| カスタマーマネージドキー | Customer-Managed Keys (CMK) | 顧客自身のキーで暗号化を制御 | P |
| 資格情報の編集 | Credential redaction | ログ・出力から機密資格情報を自動編集 | P |
| シークレット | Secret | 資格情報を安全に格納。Spark conf / 環境変数で参照 | P |
| JIT プロビジョニング | Just-In-Time provisioning | SSO ログイン中にアカウントを自動作成 | P |
| 個人用アクセストークン | Personal Access Token (PAT) | API アクセス用トークン。レガシ(OAuth 推奨) | A/P |
| コンプライアンスセキュリティプロファイル | Compliance security profile | 各種フレームワークに対応した強化設定 | P |
| 拡張セキュリティ監視 | Enhanced Security Monitoring | セキュリティ異常・脅威の検出 | P |
| サーバーレス エグレス制御 | Serverless egress control | サーバーレスの外向き通信を制御(ネットワークポリシー) | P |
| VNet インジェクション | VNet injection | 独自の仮想ネットワークにデプロイ | P |
| ANSI モード | ANSI mode (spark.sql.ansi.enabled) | 有効推奨。無効だとキャスト失敗がサイレント NULL 化 | P |
14. 監視 / アラート
| 日本語 | English | 一言説明 | 範囲 |
|---|---|---|---|
| 監査ログ | Audit logs | system.access.audit。誰がいつ何にアクセスしたか | P |
| 課金対象使用状況 | Billable usage | system.billing.usage。コスト監視の中心 | P |
| 料金テーブル | List prices | system.billing.list_prices。usage と結合して USD 換算 | P |
| ジョブ実行タイムライン | job_run_timeline | 開始/終了・結果状態・終了コード | P |
| SCD2 テーブル | Slowly changing dimension (type 2) | jobs / job_tasks / pipelines が該当 | P |
| 結果状態 | result_state | SUCCEEDED / FAILED / SKIPPED / CANCELLED / TIMED_OUT 等。最終行のみ設定 | P |
| 終了コード | termination_code | SUCCESS / DRIVER_ERROR / CLUSTER_ERROR 等 | P |
| 実行種別 | run_type | JOB_RUN / SUBMIT_RUN / WORKFLOW_RUN | P |
| データ品質監視 | Data quality monitoring | 旧 Lakehouse Monitoring。異常検知+データプロファイル | P |
| 異常検知 | Anomaly detection | 鮮度と完全性を自動評価。インテリジェントスキャン | P |
| 鮮度 | Freshness | 最近更新されたか。異常に遅れると「古い(stale)」 | P |
| 完全性 | Completeness | 過去 24 時間の書き込み行数。下限未満で「不完全」 | P |
| データプロファイリング | Data profiling | 概要統計・分布・モデル性能を時系列でキャプチャ | P |
| プロファイルメトリックテーブル | _profile_metrics | 列×時間ウィンドウ×スライス×グループの概要統計 | P |
| ドリフトメトリックテーブル | _drift_metrics | 分布変化を追跡 | P |
| 連続ドリフト | Consecutive drift | 直前の時間ウィンドウと比較 | P |
| ベースラインドリフト | Baseline drift | ベースラインテーブルと比較(提供時のみ) | P |
| スライス | Slice (slicing_exprs) | データの部分集合。テーブル全体は slice_key = NULL | P |
| 分析タイプ | Analysis type | Snapshot / TimeSeries / InferenceLog | P |
| 母集団安定性指標 | Population Stability Index (PSI) | 数値列のドリフト指標 | P |
| SQL アラート | Databricks SQL Alerts | 条件成立で通知。状態は OK / TRIGGERED / ERROR | P |
| 通知先 | Notification destination | 管理者が作る再利用可能な宛先。Email/Slack/Teams/PagerDuty/Webhook | P |
| 再通知間隔 | Notification frequency | OK に戻るまで通知を繰り返す間隔 | P |
| クエリプロファイル | Query profile | クエリの実行詳細。サーバーレスでは Spark UI の代替 | A/P |
| 予約 ID | reservoirId | Delta トランザクションログの一意 ID。UC の tableId とは別 | P |
15. CI/CD / デバッグ
| 日本語 | English | 一言説明 | 範囲 |
|---|---|---|---|
| 宣言型オートメーション バンドル | Declarative Automation Bundles | 旧 Databricks Asset Bundles (DAB)。YAML で IaC | A/P |
| メイン構成ファイル | databricks.yml | ルートに1 つだけ。追加は include で参照 | A/P |
| ターゲット | Target | デプロイ先環境の宣言。default: true は 1 つだけ | A/P |
| デプロイモード | Deployment mode | development / production | A/P |
| プリセット | Presets | 優先順位は個別リソース > presets > mode | P |
| リソース | Resources | jobs / pipelines / dashboards / clusters / volumes など | A/P |
| リソースキー | Resource key | databricks bundle run <key> の対象 | A |
| バンドルの一意性 | Bundle uniqueness | 名前 × ターゲット × デプロイ元 ID | P |
| Databricks CLI | Databricks CLI | REST API のラッパー。バンドルには v0.218.0 以降が必要 | A/P |
| 構成プロファイル | Configuration profile (.databrickscfg) | 認証設定の保存単位。-p / --profile で選択 | A/P |
| OAuth U2M 認証 | OAuth user-to-machine | 対話的ログインで短命トークン。開発で推奨 | A/P |
| OAuth M2M 認証 | OAuth machine-to-machine | サービスプリンシパルの非対話認証。自動化向け | A/P |
| ワークロード ID フェデレーション | Workload Identity Federation | Databricks シークレット不要。CI/CD で最も安全 | P |
| サービスプリンシパル | Service principal | 自動化用 ID。本番デプロイで推奨(run_as) | A/P |
| Git フォルダー | Git folders | 旧 Repos。ビジュアル Git クライアント+API | A/P |
| スパースチェックアウト | Sparse checkout | cone パターンで一部だけ複製。作成時のみ有効化可・無効化不可 | A |
| トランクベース分岐 | Trunk-based branching | Databricks 推奨のブランチ戦略 | P |
| MLOps Stacks | MLOps Stacks | バンドル+事前構成 CI/CD+テンプレート | P |
特に間違えやすい「対」の用語
| 混同しやすい組 | 決定的な違い |
|---|---|
| スキーマ適用 / スキーマ進化 | 適用=書き込み時に弾く / 進化=書き換えずに変える |
schemaLocation / checkpointLocation | 前者=スキーマの変遷を保存(進化に必須) / 後者=処理済みファイルを保存(増分再開に必須) |
| 自動圧縮 / 最適化された書き込み | 前者=書き込み後に結合 / 後者=書き込み前にシャッフルしてサイズを整える |
ZORDER / 液体クラスタリング | 前者=液体クラスタリングのないテーブル用 / 後者=新規テーブルの推奨。併用不可 |
| CDF / AUTO CDC | 前者=変更を記録・読み取る / 後者=変更を適用して SCD を作る |
| Expectations / データ品質監視 | 前者=パイプライン内のインライン品質 / 後者=テーブルの事後・継続観測 |
MANAGE / 所有権 | MANAGE は権限管理・譲渡・削除ができるが全特権は自動付与されない |
USE CATALOG / SELECT | 使用特権は前提条件でデータアクセスは許可しない。両方必要 |
| マネージド(テーブル)/ 「UC が管理する」 | 前者=ストレージのライフサイクルも UC が管理 / 後者=外部テーブルも含む全登録オブジェクト |
is_account_group_member() / is_member() | 後者は Hive 互換でアカウントレベルを評価しない → UC では使わない |
| ROWS / RANGE | 前者=物理行数(タイも個別) / 後者=値のオフセット(同値をまとめる) |
Trigger.AvailableNow / 継続的(Continuous)モード | 前者=ストリームのトリガー / 後者=ジョブのスケジュール方式 |
| exactly-once / at-least-once | foreachBatch は後者のみ → txnAppId + txnVersion で冪等化 |
| オープン共有 / D2D 共有 | 前者=トークン/OIDC で誰とでも(表形式のみ) / 後者=トークン不要でノートブック・モデルも共有可 |
| クエリフェデレーション / カタログフェデレーション | 前者=JDBC でプッシュダウン(両側で実行) / 後者=オブジェクトストレージ直接(Databricks 上のみ) |
関連ファイル
| ファイル | 役割 |
|---|---|
| cheatsheet-numbers.md | 数値・バージョン境界の直前 1 枚 |
| ../03_associate-materials/00-index.md | Associate 教材(用語の詳細説明) |
| ../04_professional-materials/00-index.md | Professional 教材(用語の詳細説明) |
| ../05_practice-questions/ | 確認問題(用語の使い分けを問う) |
| ../08_mock-exam/ | 模擬試験 |