Associate-Developer-Apache-Spark-3.5 試験問題 11

データエンジニアは、Spark 3.0 から Spark 3.5 にアップグレードした後、パフォーマンスが向上したことに気づきました。エンジニアは、Adaptive Query Execution (AQE) が有効になっていることを発見しました。
AQE はパフォーマンスを向上させるためにどの操作を実装していますか?
  • Associate-Developer-Apache-Spark-3.5 試験問題 12

    55件中47件目。
    データ エンジニアは、2 つの DataFrame df1 と df2 を結合する次のコードを作成しました。
    df1 = spark.read.csv("sales_data.csv")
    df2 = spark.read.csv("product_data.csv")
    df_joined = df1.join(df2, df1.product_id == df2.product_id)
    DataFrame df1 には約 10 GB の販売データが含まれ、df2 には約 8 MB の製品データが含まれます。
    Spark はどの結合戦略を使用しますか?
  • Associate-Developer-Apache-Spark-3.5 試験問題 13

    開発者がSpark SQLクエリを実行したところ、リソースが十分に活用されていないことに気づきました。エグゼキューターはアイドル状態であり、ステージあたりのタスク数も少なくなっています。
    クラスターの使用率を向上させるために開発者は何をすべきでしょうか?
  • Associate-Developer-Apache-Spark-3.5 試験問題 14

    55 件中 12 件目。
    あるデータサイエンティストが、モデルの機能構築のため、ユーザープロファイルデータを調査していました。探索的データ分析の結果、ユーザープロファイルの一部のレコードには、NULL値が多すぎるフィールドが含まれているため、役に立たないことが判明しました。
    ユーザー プロファイル テーブルのスキーマは次のようになります。
    ユーザーID 文字列、
    ユーザー名文字列、
    生年月日 DATE、
    国 STRING、
    created_at タイムスタンプ
    データ サイエンティストは、いずれかのレコードのいずれかのフィールドに NULL 値が含まれている場合、さらに処理を進める前にそのレコードを出力から削除することに決めました。
    これらの要件を満たすために使用できる Spark コード ブロックはどれですか?
  • Associate-Developer-Apache-Spark-3.5 試験問題 15

    55 件中 6 件目。
    Apache Spark のアーキテクチャのどのコンポーネントが、割り当てられたときにタスクを実行する責任がありますか?