Databricks-Certified-Data-Engineer-Professional 試験問題 11
ジュニアデータエンジニアが、silver_device_recordingsという名前のLakehouseテーブルのロジックを実装する作業を行っています。ソースデータには、高度にネストされたJSON構造で100個の固有フィールドが含まれています。
silver_device_recordingsテーブルは、下流工程で複数の生産監視ダッシュボードと生産モデルに利用されます。現在、100個のフィールドのうち45個が、これらのアプリケーションの少なくとも1つで使用されています。
データエンジニアは、データの高度にネストされた構造と多数のフィールドを考慮し、スキーマ宣言を扱うための最適なアプローチを決定しようとしている。
以下のうち、デルタレイクとデータブリックスの意思決定プロセスに影響を与える可能性のある情報を正確に提示しているのはどれですか?
silver_device_recordingsテーブルは、下流工程で複数の生産監視ダッシュボードと生産モデルに利用されます。現在、100個のフィールドのうち45個が、これらのアプリケーションの少なくとも1つで使用されています。
データエンジニアは、データの高度にネストされた構造と多数のフィールドを考慮し、スキーマ宣言を扱うための最適なアプローチを決定しようとしている。
以下のうち、デルタレイクとデータブリックスの意思決定プロセスに影響を与える可能性のある情報を正確に提示しているのはどれですか?
Databricks-Certified-Data-Engineer-Professional 試験問題 12
あるデータ企業はDatabricks Unity Catalogを使用しており、PostgreSQL、Snowflake、SQL Serverなど複数のエンタープライズデータソースを保有しています。中央データプラットフォームチームは、アナリストがデータの重複なしにDatabricks SQLを使用してDatabricks内で外部テーブルを直接クエリできるように、Lakehouse Federationを構成したいと考えています。Lakehouse Federationを安全かつ適切に構成するために必要な手順は何ですか?
Databricks-Certified-Data-Engineer-Professional 試験問題 13
統合テストについて説明しているのは、次のうちどれですか?
Databricks-Certified-Data-Engineer-Professional 試験問題 14
データエンジニアが、医療費請求データを処理するためのLakeflow Declarative Pipelinesパイプラインを構築しています。メタデータJSONファイルには、以下の複数のテーブルに対するデータ品質ルールが定義されています。
{
「クレーム」: [
{"name": "valid_patient_id", "constraint": "patient_id IS NOT NULL"},
{"name": "non_negative_amount", "constraint": "claim_amount >= 0"}
]
}
パイプラインは、これらのルールをハードコーディングすることなく、クレームテーブルに動的に適用する必要があります。
データエンジニアはどのようにしてこれを実現すべきでしょうか?
{
「クレーム」: [
{"name": "valid_patient_id", "constraint": "patient_id IS NOT NULL"},
{"name": "non_negative_amount", "constraint": "claim_amount >= 0"}
]
}
パイプラインは、これらのルールをハードコーディングすることなく、クレームテーブルに動的に適用する必要があります。
データエンジニアはどのようにしてこれを実現すべきでしょうか?
Databricks-Certified-Data-Engineer-Professional 試験問題 15
A data engineer is reviewing the PySpark code to copy a part of the production dataset to the sandbox environment, and needs to be sure that no PII(Personally Identifiable Information) data is being copied. After checking the sales table, the data engineer notices that it has user emails as the only PII data included as well as being the only column to identify the user.
from pyspark.sql import functions as F

Which anonymised code should be used to achieve the required outcome?
from pyspark.sql import functions as F

Which anonymised code should be used to achieve the required outcome?
