DP-600J 試験問題 11

PySpark を使用して Fabric ノートブックで顧客の購入を分析しています。
次の DataFrame があります。
- トランザクション: transaction_idという名前の5つの列が含まれます。
customer_id、product_id、amount、date で構成され、1,000 万行あり、各行はトランザクションを表します。
- 顧客: 1,000行3列の顧客詳細が含まれます
customer_id、name、country という名前です。
customer_id 列で DataFrame を結合する必要があります。ソリューションでは、データのシャッフルを最小限に抑える必要があります。
次のコードを記述します。
pyspark.sqlから関数をFとしてインポートします
結果 =
結果の DataFrame を入力するにはどのコードを実行する必要がありますか?
  • DP-600J 試験問題 12

    注: この質問は、同じシナリオを提示する一連の質問の一部です。一連の質問にはそれぞれ、定められた目標を満たす独自の解決策が含まれています。質問セットによっては、正しい解決策が複数ある場合もあれば、正しい解決策がない場合もあります。
    このセクションで質問に答えた後は、そのセクションに戻ることはできません。そのため、これらの質問はレビュー画面に表示されません。
    OneLake に新しいセマンティック モデルを含む Fabric テナントがあります。
    Fabric ノートブックを使用して、データを Spark DataFrame に読み込みます。
    すべての文字列列と数値列の最小値、最大値、平均値、標準偏差値を計算するために、データを評価する必要があります。
    解決策: 次の PySpark 式を使用します: df.show()
    これは目標を満たしていますか?
  • DP-600J 試験問題 13

    OneLake に Parquet ファイルとして保存された顧客離脱データを含む Fabric テナントがあります。
    データには、顧客の人口統計と製品の使用状況に関する詳細が含まれています。
    Fabric ノートブックを作成し、データを Spark DataFrame に読み込みます。次に、ノートブックに縦棒グラフを作成し、地理、購入した製品の数、年齢、顧客期間に基づいて、保持された顧客と失った顧客の分布を表示します。
    どのような種類の分析を実行していますか?
  • DP-600J 試験問題 14

    次の図に示す Python コードと出力を含む Fabric ノートブックがあります。

    どのような種類の分析を実行していますか?
  • DP-600J 試験問題 15

    DW1 という名前の倉庫と LH1 という名前のレイクハウスを含む Fabric テナントがあります。
    DW1 には Sales.Product という名前のテーブルが含まれています。LH1 には Sales.Orders という名前のテーブルが含まれています。
    DW1 に Sales.ProductOrder という新しいポイントインタイム (PIT) テーブルを作成する自動プロセスをスケジュールする予定です。Sales.ProductOrder は、Sales.Product と Sales.Orders を結合するクエリの結果を使用して構築されます。
    Sales.ProductOrder の列の型がソース テーブルの列の型と一致していることを確認する必要があります。ソリューションでは、新しいテーブルを作成するために必要な操作の数を最小限に抑える必要があります。
    どの操作を使用すればよいですか?