Databricks-Certified-Data-Engineer-Professional 試験問題 56

データエンジニアは、顧客がレンタル自転車を利用中にどこへ持ち運んでいるかを把握するために、データ取り込みパイプラインを構築している。エンジニアは、自転車のセンサーから送信されるデータに、緯度や経度といった重要な詳細情報が徐々に欠落していくことに気づいた。下流のアナリストは、クリーンなデータと隔離されたデータの両方を個別に処理するために必要としている。
データエンジニアは既にこのコードを持っています。
dltをインポート
from pyspark.sql.functions import expr
ルール = {
"valid_lat": "(lat は NULL ではありません)",
"valid_long": "(long IS NOT NULL)"
}
quarantine_rules = "NOT({})".format(" AND ".join(rules.values()))
@dlt.view
def raw_trips_data():
return spark.readStream.table("ride_and_go.telemetry.trips")
データエンジニアは、良質なデータと不良なデータを把握するという要件をどのように満たすべきでしょうか?
  • Databricks-Certified-Data-Engineer-Professional 試験問題 57

    分析チームは、データエンジニアリングチームが作成した顧客トランザクションのDeltaテーブル(約200億件のレコード)に対して、Databricks SQLで短期的な実験を実行したいと考えています。データエンジニアリングチームは、ダウンタイムを最小限に抑え、進行中のETLプロセスに影響を与えないようにするために、どのような戦略を採用すべきでしょうか?
  • Databricks-Certified-Data-Engineer-Professional 試験問題 58

    Spark UIのどこで、述語プッシュダウンを活用していないことに起因するパフォーマンスの問題を診断できますか?
  • Databricks-Certified-Data-Engineer-Professional 試験問題 59

    データエンジニアが、時折重複したメッセージを送信するメッセージバスシステムからデータを取り込むパイプラインを構築しています。重複メッセージの送信間隔は1週間ほどになる場合があります。ターゲットはDatabricks Delta Lakeテーブルで、各レコードは正確に1回だけ出現する必要があります。設定されたウォーターマークの範囲外でイベントが到着する可能性がある場合に、重複メッセージを処理するには、どのDatabricksデータ取り込みパターンを実装すべきでしょうか?
  • Databricks-Certified-Data-Engineer-Professional 試験問題 60

    コンピューティングリソースを最も多く消費しているユーザーを特定するには、データエンジニアリングチームは、リソースの利用効率とコスト管理を向上させるために、Databricksワークスペース内の使用状況を監視する必要があります。
    チームは、ワークスペースのアクティビティを詳細に把握するために、UnityカタログのシステムカタログにあるDatabricksシステムテーブルを使用することにしました。この目的を達成するには、チームはシステムカタログからどのSQLクエリを実行すればよいでしょうか?