Associate-Developer-Apache-Spark-3.5 試験問題 11
データエンジニアは、Spark 3.0 から Spark 3.5 にアップグレードした後、パフォーマンスが向上したことに気づきました。エンジニアは、Adaptive Query Execution (AQE) が有効になっていることを発見しました。
AQE はパフォーマンスを向上させるためにどの操作を実装していますか?
AQE はパフォーマンスを向上させるためにどの操作を実装していますか?
Associate-Developer-Apache-Spark-3.5 試験問題 12
55件中47件目。
データ エンジニアは、2 つの DataFrame df1 と df2 を結合する次のコードを作成しました。
df1 = spark.read.csv("sales_data.csv")
df2 = spark.read.csv("product_data.csv")
df_joined = df1.join(df2, df1.product_id == df2.product_id)
DataFrame df1 には約 10 GB の販売データが含まれ、df2 には約 8 MB の製品データが含まれます。
Spark はどの結合戦略を使用しますか?
データ エンジニアは、2 つの DataFrame df1 と df2 を結合する次のコードを作成しました。
df1 = spark.read.csv("sales_data.csv")
df2 = spark.read.csv("product_data.csv")
df_joined = df1.join(df2, df1.product_id == df2.product_id)
DataFrame df1 には約 10 GB の販売データが含まれ、df2 には約 8 MB の製品データが含まれます。
Spark はどの結合戦略を使用しますか?
Associate-Developer-Apache-Spark-3.5 試験問題 13
開発者がSpark SQLクエリを実行したところ、リソースが十分に活用されていないことに気づきました。エグゼキューターはアイドル状態であり、ステージあたりのタスク数も少なくなっています。
クラスターの使用率を向上させるために開発者は何をすべきでしょうか?
クラスターの使用率を向上させるために開発者は何をすべきでしょうか?
Associate-Developer-Apache-Spark-3.5 試験問題 14
55 件中 12 件目。
あるデータサイエンティストが、モデルの機能構築のため、ユーザープロファイルデータを調査していました。探索的データ分析の結果、ユーザープロファイルの一部のレコードには、NULL値が多すぎるフィールドが含まれているため、役に立たないことが判明しました。
ユーザー プロファイル テーブルのスキーマは次のようになります。
ユーザーID 文字列、
ユーザー名文字列、
生年月日 DATE、
国 STRING、
created_at タイムスタンプ
データ サイエンティストは、いずれかのレコードのいずれかのフィールドに NULL 値が含まれている場合、さらに処理を進める前にそのレコードを出力から削除することに決めました。
これらの要件を満たすために使用できる Spark コード ブロックはどれですか?
あるデータサイエンティストが、モデルの機能構築のため、ユーザープロファイルデータを調査していました。探索的データ分析の結果、ユーザープロファイルの一部のレコードには、NULL値が多すぎるフィールドが含まれているため、役に立たないことが判明しました。
ユーザー プロファイル テーブルのスキーマは次のようになります。
ユーザーID 文字列、
ユーザー名文字列、
生年月日 DATE、
国 STRING、
created_at タイムスタンプ
データ サイエンティストは、いずれかのレコードのいずれかのフィールドに NULL 値が含まれている場合、さらに処理を進める前にそのレコードを出力から削除することに決めました。
これらの要件を満たすために使用できる Spark コード ブロックはどれですか?
Associate-Developer-Apache-Spark-3.5 試験問題 15
55 件中 6 件目。
Apache Spark のアーキテクチャのどのコンポーネントが、割り当てられたときにタスクを実行する責任がありますか?
Apache Spark のアーキテクチャのどのコンポーネントが、割り当てられたときにタスクを実行する責任がありますか?
