Databricks-Certified-Data-Engineer-Professional 試験問題 86
データパイプラインは、構造化ストリーミングを使用して、KafkaからDelta Lakeにデータを取り込みます。データはBronzeテーブルに保存され、Kafkaで生成されたタイムスタンプ、キー、および値が含まれます。パイプラインのデプロイから3か月後、データエンジニアリングチームは、1日の特定の時間帯に遅延が発生していることに気づきました。
上級データエンジニアが、Delta Tableのスキーマと取り込みロジックを更新し、現在のタイムスタンプ(Apache Sparkによって再コード化されたもの)に加え、Kafkaのトピックとパーティションを含めるようにしました。チームは、追加されたメタデータフィールドを使用して、一時的な処理遅延の原因を診断する予定です。
この問題の診断において、チームはどのような制約に直面するでしょうか?
上級データエンジニアが、Delta Tableのスキーマと取り込みロジックを更新し、現在のタイムスタンプ(Apache Sparkによって再コード化されたもの)に加え、Kafkaのトピックとパーティションを含めるようにしました。チームは、追加されたメタデータフィールドを使用して、一時的な処理遅延の原因を診断する予定です。
この問題の診断において、チームはどのような制約に直面するでしょうか?
Databricks-Certified-Data-Engineer-Professional 試験問題 87
ジュニアデータエンジニアが、Databricks REST APIエンドポイント2.0/jobs/createに以下のJSONを送信するワークロードを設定しました。

すべての構成と参照リソースが利用可能であると仮定した場合、このワークロードを3回実行した結果を説明しているのは次のうちどれですか?

すべての構成と参照リソースが利用可能であると仮定した場合、このワークロードを3回実行した結果を説明しているのは次のうちどれですか?
Databricks-Certified-Data-Engineer-Professional 試験問題 88
ビューの更新は、顧客テーブルに挿入または更新されるすべての新しく取り込まれたデータの増分バッチを表します。
これらのレコードを処理するために、以下のロジックが使用されます。
顧客を統合する
使用(
SELECT updates.customer_id as merge_ey, updates .*
FROMアップデート
ユニオンオール
SELECT NULL as merge_key, updates .*
更新情報から顧客に参加
ON updates.customer_id = customers.customer_id
WHERE customers.current = true AND updates.address <> customers.address ) staged_updates ON customers.customer_id = mergekey WHEN MATCHED AND customers. current = true AND customers.address <> staged_updates.address THEN UPDATE SET current = false, end_date = staged_updates.effective_date WHEN NOT MATCHED THEN INSERT (customer_id, address, current, effective_date, end_date) VALUES (staged_updates.customer_id, staged_updates.address, true, staged_updates.effective_date, null) この実装を説明するステートメントはどれですか?
これらのレコードを処理するために、以下のロジックが使用されます。
顧客を統合する
使用(
SELECT updates.customer_id as merge_ey, updates .*
FROMアップデート
ユニオンオール
SELECT NULL as merge_key, updates .*
更新情報から顧客に参加
ON updates.customer_id = customers.customer_id
WHERE customers.current = true AND updates.address <> customers.address ) staged_updates ON customers.customer_id = mergekey WHEN MATCHED AND customers. current = true AND customers.address <> staged_updates.address THEN UPDATE SET current = false, end_date = staged_updates.effective_date WHEN NOT MATCHED THEN INSERT (customer_id, address, current, effective_date, end_date) VALUES (staged_updates.customer_id, staged_updates.address, true, staged_updates.effective_date, null) この実装を説明するステートメントはどれですか?
Databricks-Certified-Data-Engineer-Professional 試験問題 89
上流システムから、クラウドオブジェクトストレージディレクトリに書き込まれる変更データキャプチャ(CDC)ログが出力されます。ログ内の各レコードには、変更の種類(挿入、更新、削除)と、変更後の各フィールドの値が示されます。ソーステーブルには、pk_idフィールドで識別される主キーがあります。
監査目的のため、データガバナンスチームは、ソースシステムで過去に有効であったすべての値の完全な記録を保持したいと考えています。分析目的のため、各レコードの最新の値のみを記録すれば十分です。これらのレコードを取り込むDatabricksジョブは1時間に1回実行されますが、個々のレコードは1時間の間に複数回変更されている可能性があります。
これらの要件を満たすソリューションはどれですか?
監査目的のため、データガバナンスチームは、ソースシステムで過去に有効であったすべての値の完全な記録を保持したいと考えています。分析目的のため、各レコードの最新の値のみを記録すれば十分です。これらのレコードを取り込むDatabricksジョブは1時間に1回実行されますが、個々のレコードは1時間の間に複数回変更されている可能性があります。
これらの要件を満たすソリューションはどれですか?
Databricks-Certified-Data-Engineer-Professional 試験問題 90
user_ltvという名前のテーブルは、さまざまなチームのデータアナリストが使用するビューを作成するために使用されます。ワークスペース内のユーザーはグループに分けられ、そのグループはACLを使用してデータアクセスを設定するために使用されます。
user_ltvテーブルのスキーマは以下のとおりです。
email 文字列、age 整数、ltv 整数
以下のビュー定義が実行されます。

監査グループに所属していないアナリストが、以下のクエリを実行します。
SELECT * FROM user_ltv_no_minors
このクエリによって返される結果を説明しているのは、次のうちどれですか?
user_ltvテーブルのスキーマは以下のとおりです。
email 文字列、age 整数、ltv 整数
以下のビュー定義が実行されます。

監査グループに所属していないアナリストが、以下のクエリを実行します。
SELECT * FROM user_ltv_no_minors
このクエリによって返される結果を説明しているのは、次のうちどれですか?
