Databricks-Certified-Data-Engineer-Professional 試験問題 66

DatabricksプラットフォームにおけるSparkの設定に関して、正しい記述はどれですか?
  • Databricks-Certified-Data-Engineer-Professional 試験問題 67

    データエンジニアが、user_idでグループ化された膨大なユーザーアクティビティログに対してgroupBy集計を実行しています。一部のユーザーには数百万件のレコードがあり、タスクの偏りや実行時間の長期化を引き起こしています。この集計における偏りを解消するには、どの手法が有効でしょうか?
  • Databricks-Certified-Data-Engineer-Professional 試験問題 68

    Databricksジョブは3つのタスクで構成されており、各タスクはDatabricksノートブックです。タスクAは他のタスクに依存しません。タスクBとCは並列で実行され、それぞれタスクAに直列依存しています。
    タスクAとタスクBが正常に完了したが、タスクCがスケジュールされた実行中に失敗した場合、結果として生じる状態を説明しているのは次のうちどれですか?
  • Databricks-Certified-Data-Engineer-Professional 試験問題 69

    データサイエンスチームは、ユーザーレビューの自由形式テキストに対するクエリの高速化について支援を要請しました。データは現在、以下のスキーマを持つParquet形式で保存されています。
    item_id INT、user_id INT、review_id INT、rating FLOAT、review STRING
    レビュー欄には、ユーザーが残したレビューの全文が表示されます。具体的には、データサイエンスチームは、この欄に30個のキーワードのいずれかが含まれているかどうかを特定しようとしています。
    若手データエンジニアは、このデータをDelta Lakeに変換することでクエリのパフォーマンスが向上すると提案している。
    ジュニアデータエンジニアの提案に対する正しい回答はどれですか?
  • Databricks-Certified-Data-Engineer-Professional 試験問題 70

    データエンジニアは、修復履歴を含む最新のジョブ実行に関する情報を収集するアプリケーションを作成する必要があります。データエンジニアは、リクエストをどのようにフォーマットすべきでしょうか?