Associate-Developer-Apache-Spark-3.5 試験問題 26
データエンジニアは、上流のストリーミングソースから重複レコードが送信されていることに気づきました。重複レコードは同じキーを共有しており、event_timestamp のタイムスタンプの差は最大30分です。エンジニアは次のように付け加えました。
dropDuplicatesWithinWatermark("event_timestamp", "30分")
結果はどうなりましたか?
dropDuplicatesWithinWatermark("event_timestamp", "30分")
結果はどうなりましたか?
Associate-Developer-Apache-Spark-3.5 試験問題 27
55 件中 25 件目。
データ アナリストは、employees_df で作業しており、給与に対して 10% の税金を計算する新しい列を追加する必要があります。
さらに、DataFrame には不要な列 age が含まれています。
どのコードフラグメントが税金列を追加し、年齢列を削除しますか?
データ アナリストは、employees_df で作業しており、給与に対して 10% の税金を計算する新しい列を追加する必要があります。
さらに、DataFrame には不要な列 age が含まれています。
どのコードフラグメントが税金列を追加し、年齢列を削除しますか?
Associate-Developer-Apache-Spark-3.5 試験問題 28
アダプティブ クエリ実行 (AQE) の利点は何ですか?
Associate-Developer-Apache-Spark-3.5 試験問題 29
あるデータサイエンティストは、大量の構造化データの処理、SQLクエリの実行、機械学習アルゴリズムの適用を必要とするプロジェクトに取り組んでいます。このタスクにApache Sparkの使用を検討しています。
このシナリオでは、データ サイエンティストはどの Apache Spark モジュールの組み合わせを使用する必要がありますか?
オプション:
このシナリオでは、データ サイエンティストはどの Apache Spark モジュールの組み合わせを使用する必要がありますか?
オプション:
Associate-Developer-Apache-Spark-3.5 試験問題 30
55 件中 48 件目。
データ エンジニアは複数の DataFrame を結合する必要があり、次のコードを記述しました。
pyspark.sql.functionsからブロードキャストをインポートする
データ1 = [(1, "A"), (2, "B")]
データ2 = [(1, "X"), (2, "Y")]
データ3 = [(1, "M"), (2, "N")]
df1 = spark.createDataFrame(data1, ["id", "val1"])
df2 = spark.createDataFrame(data2, ["id", "val2"])
df3 = spark.createDataFrame(data3, ["id", "val3"])
df_joined = df1.join(broadcast(df2), "id", "inner") \
.join(ブロードキャスト(df3)、"id", "inner")
このコードの出力は何でしょうか?
データ エンジニアは複数の DataFrame を結合する必要があり、次のコードを記述しました。
pyspark.sql.functionsからブロードキャストをインポートする
データ1 = [(1, "A"), (2, "B")]
データ2 = [(1, "X"), (2, "Y")]
データ3 = [(1, "M"), (2, "N")]
df1 = spark.createDataFrame(data1, ["id", "val1"])
df2 = spark.createDataFrame(data2, ["id", "val2"])
df3 = spark.createDataFrame(data3, ["id", "val3"])
df_joined = df1.join(broadcast(df2), "id", "inner") \
.join(ブロードキャスト(df3)、"id", "inner")
このコードの出力は何でしょうか?

