Associate-Developer-Apache-Spark-3.5 試験問題 1

エンジニアは2つのDataFrame(df1(小)とdf2(大))を持っています。ブロードキャスト結合を使用します。
パイソン
コピー編集
pyspark.sql.functionsからブロードキャストをインポートする
結果 = df2.join(broadcast(df1), on='id', how='inner')
このシナリオでbroadcast() を使用する目的は何ですか?
オプション:
  • Associate-Developer-Apache-Spark-3.5 試験問題 2

    あるデータエンジニアは、毎日最新のデータで上書きされるParquetテーブルの作成を依頼されました。このParquetテーブルの下流の利用者には、このテーブル内のすべてのレコードがmarket_timeフィールドでソートされた状態でデータが生成されることが必須要件となっています。
    これらの要件を満たす Parquet テーブルを生成するのは、Spark コードのどの行ですか?
  • Associate-Developer-Apache-Spark-3.5 試験問題 3

    あるeコマース企業のデータサイエンティストは、サブスクライバーデータベースから取得したユーザーデータを処理しており、そのデータをDataFrame df_userに格納しています。このデータをさらに処理する前に、データサイエンティストは別のDataFrame df_user_non_piiを作成し、このDataFrameにPII以外の列のみを格納したいと考えています。df_userのPII列は、first_name、last_name、email、birthdateです。
    この要件を満たすために使用できるコード スニペットはどれですか?
  • Associate-Developer-Apache-Spark-3.5 試験問題 4

    データ エンジニアは、feed と呼ばれる Kafka トピックから読み取るストリーミング データフレームを作成したいと考えています。

    要件を満たすには、5 行目にどのコード フラグメントを挿入する必要がありますか?
    コードコンテキスト:
    スパーク\
    .readStream \
    .format("カフカ") \
    .option("kafka.bootstrap.servers", "ホスト1:ポート1,ホスト2:ポート2") \
    .[5行目] \
    。負荷()
    オプション:
  • Associate-Developer-Apache-Spark-3.5 試験問題 5

    データ エンジニアは、列国別にパーティション化された DataFramedf を Parquet ファイルに書き込み、宛先パスにある既存のデータを上書きする必要があります。
    データ エンジニアは、Apache Spark でこのタスクを実行するためにどのコードを使用すればよいですか。