Associate-Developer-Apache-Spark-3.5 試験問題 6

開発者は、次のコードを使用して、sales.purchases_fct と sales.customer_dim の 2 つのテーブルを結合しようとしています。

fact_df = purch_df.join(cust_df, F.col('customer_id') == F.col('custid')) 開発者は、customer_dim テーブルに存在しない purchases_fct テーブル内の顧客が結合テーブルから削除されていることを発見しました。
これらの顧客レコードが削除されないようにするには、コードにどのような変更を加える必要がありますか?
  • Associate-Developer-Apache-Spark-3.5 試験問題 7

    55 件中 9 件目。
    次のコードフラグメントがあるとします:
    pyspark.pandasをpsとしてインポートする
    pdf = ps.DataFrame(データ)
    Spark DataFrame (pyspark.pandas.DataFrame) 上の Pandas API を標準の PySpark DataFrame (pyspark.sql.DataFrame) に変換するにはどの方法を使用しますか?
  • Associate-Developer-Apache-Spark-3.5 試験問題 8

    55 件中 36 件目。
    テーブルを永続化するときにデータをパーティション分割する主な利点は何ですか?
  • Associate-Developer-Apache-Spark-3.5 試験問題 9

    データエンジニアは、sensor_id、temperature、timestampの列を持つセンサーの読み取りデータを毎秒受信するストリーミングデータフレームを処理したいと考えています。エンジニアは、データのストリーミング中に、過去5分間の各センサーの平均温度を計算する必要があります。
    どのコード実装が要件を満たしていますか?
    提供された画像からのオプション:
  • Associate-Developer-Apache-Spark-3.5 試験問題 10

    あるデータサイエンティストが、PySparkを使用してApache Sparkの大規模データセットに取り組んでいます。データサイエンティストは、user_id、product_id、purchase_amountの列を持つDataFrame dfを所有しており、このデータに対していくつかの操作を効率的に実行する必要があります。
    シャッフルを必要とする変換と、それに続くシャッフルを必要としない変換が生じる操作シーケンスはどれですか?