Associate-Developer-Apache-Spark-3.5 試験問題 6
開発者は、次のコードを使用して、sales.purchases_fct と sales.customer_dim の 2 つのテーブルを結合しようとしています。

fact_df = purch_df.join(cust_df, F.col('customer_id') == F.col('custid')) 開発者は、customer_dim テーブルに存在しない purchases_fct テーブル内の顧客が結合テーブルから削除されていることを発見しました。
これらの顧客レコードが削除されないようにするには、コードにどのような変更を加える必要がありますか?

fact_df = purch_df.join(cust_df, F.col('customer_id') == F.col('custid')) 開発者は、customer_dim テーブルに存在しない purchases_fct テーブル内の顧客が結合テーブルから削除されていることを発見しました。
これらの顧客レコードが削除されないようにするには、コードにどのような変更を加える必要がありますか?
Associate-Developer-Apache-Spark-3.5 試験問題 7
55 件中 9 件目。
次のコードフラグメントがあるとします:
pyspark.pandasをpsとしてインポートする
pdf = ps.DataFrame(データ)
Spark DataFrame (pyspark.pandas.DataFrame) 上の Pandas API を標準の PySpark DataFrame (pyspark.sql.DataFrame) に変換するにはどの方法を使用しますか?
次のコードフラグメントがあるとします:
pyspark.pandasをpsとしてインポートする
pdf = ps.DataFrame(データ)
Spark DataFrame (pyspark.pandas.DataFrame) 上の Pandas API を標準の PySpark DataFrame (pyspark.sql.DataFrame) に変換するにはどの方法を使用しますか?
Associate-Developer-Apache-Spark-3.5 試験問題 8
55 件中 36 件目。
テーブルを永続化するときにデータをパーティション分割する主な利点は何ですか?
テーブルを永続化するときにデータをパーティション分割する主な利点は何ですか?
Associate-Developer-Apache-Spark-3.5 試験問題 9
データエンジニアは、sensor_id、temperature、timestampの列を持つセンサーの読み取りデータを毎秒受信するストリーミングデータフレームを処理したいと考えています。エンジニアは、データのストリーミング中に、過去5分間の各センサーの平均温度を計算する必要があります。
どのコード実装が要件を満たしていますか?
提供された画像からのオプション:
どのコード実装が要件を満たしていますか?
提供された画像からのオプション:
Associate-Developer-Apache-Spark-3.5 試験問題 10
あるデータサイエンティストが、PySparkを使用してApache Sparkの大規模データセットに取り組んでいます。データサイエンティストは、user_id、product_id、purchase_amountの列を持つDataFrame dfを所有しており、このデータに対していくつかの操作を効率的に実行する必要があります。
シャッフルを必要とする変換と、それに続くシャッフルを必要としない変換が生じる操作シーケンスはどれですか?
シャッフルを必要とする変換と、それに続くシャッフルを必要としない変換が生じる操作シーケンスはどれですか?
