Databricks-Certified-Data-Engineer-Professional 試験問題 26

以下の各構成は、各クラスターが合計400GBのRAM、合計160個のコア、およびVMごとに1つのエグゼキュータのみを持つという点で同一です。
完了が保証されなければならない非常に長時間の実行が必要なジョブがある場合、1つ以上の仮想マシンの障害が発生したとしても、ジョブの完了を保証できるクラスタ構成はどれでしょうか?
  • Databricks-Certified-Data-Engineer-Professional 試験問題 27

    データエンジニアがAuto Loaderを使用して、受信したJSONデータをリアルタイムで読み込んでいます。Auto Loaderは無効なJSONレコードを隔離するように設定されていますが、時間が経つにつれて、形式が正しいJSONであるにもかかわらず、一部のレコードが隔離されるようになっていることに気づきました。
    コードスニペットは以下のとおりです。
    df = (spark.readStream
    .format("cloudFiles")
    .option("cloudFiles.format", "json")
    .option("badRecordsPath", "/tmp/somewhere/badRecordsPath")
    .schema("a int, b int")
    .load("/Volumes/catalog/schema/raw_data/"))
    データが欠落している原因は何ですか?
  • Databricks-Certified-Data-Engineer-Professional 試験問題 28

    Apache Kafkaプロデューサーからのすべてのレコードは、以下のスキーマを持つ単一のDelta Lakeテーブルに取り込まれます。
    キー BINARY、値 BINARY、トピック STRING、パーティション LONG、オフセット LONG、タイムスタンプ LONG 取り込まれるトピックは 5 つです。「registration」トピックのみに個人識別情報 (PII) が含まれています。会社は PII へのアクセスを制限したいと考えています。また、会社は、このテーブルに PII を含むレコードを、最初の取り込み後 14 日間のみ保持したいと考えています。
    ただし、個人情報以外の情報については、これらの記録を無期限に保持したいと考えています。
    以下の解決策のうち、要件を満たすものはどれですか?
  • Databricks-Certified-Data-Engineer-Professional 試験問題 29

    テキストエディタで表示した場合、DatabricksのPythonノートブックの最初の部分はどのようなものですか?
  • Databricks-Certified-Data-Engineer-Professional 試験問題 30

    データエンジニアが、遅れて到着する可能性のある重複レコードを処理するパイプラインを構成している。
    バッチ内のレコードの重複排除に加えて、データエンジニアがデルタテーブルに挿入される際に、以前に処理されたレコードに対してデータの重複排除を行うことができる方法は次のうちどれですか?