Professional-Data-Engineer 試験問題 26

地震データを分析するシステムを設計しています。抽出、変換、ロード(ETL)プロセスは、Apache Hadoop クラスター上で一連の MapReduce ジョブとして実行されます。ETL プロセスでは、一部のステップの計算コストが高いため、データセットの処理に数日かかります。その後、センサーのキャリブレーションステップが省略されていることが判明しました。将来的にセンサーのキャリブレーションを体系的に実行するために、ETL プロセスをどのように変更すればよいでしょうか。
  • Professional-Data-Engineer 試験問題 27

    次の条件を満たすクラウドネイティブの履歴データ処理システムを設計しています。
    * 分析対象のデータは CSV、Avro、PDF 形式で、Cloud Dataproc、BigQuery、Compute Engine などの複数の分析ツールからアクセスされます。
    * ストリーミング データ パイプラインは毎日新しいデータを保存します。
    * パフォーマンスはソリューションの要素ではありません。
    * ソリューション設計では可用性を最大化する必要があります。
    このソリューションのデータストレージをどのように設計すればよいでしょうか?
  • Professional-Data-Engineer 試験問題 28

    大手不動産会社で勤務しており、機械学習に使用する6TBの住宅販売データを準備しています。SQLを使用してデータを変換し、BigQuery MLを使用して機械学習モデルを作成します。このモデルを使用して、変換されていない生のデータセットに対する予測を行う予定です。予測時の偏りを防ぐために、ワークフローをどのように設定すればよいでしょうか?
  • Professional-Data-Engineer 試験問題 29

    貴社では、WHILECARDテーブルを使用して、類似した名前を持つ複数のテーブルにまたがるデータクエリを実行しています。現在、SQL文が以下のエラーで失敗しています。
    # 構文エラー: 文の終わりを期待しましたが、[4:11] で "-" を取得しました
    年齢を選択
    から
    bigquery-public-data.noaa_gsod.gsod
    どこ
    年齢 != 99
    AND_TABLE_SUFFIX = '1929'
    注文方法
    年齢 DESC
    どのテーブル名で SQL ステートメントが正しく機能しますか?
  • Professional-Data-Engineer 試験問題 30

    あなたのスタートアップでは、正式なセキュリティポリシーを一度も導入したことがありません。現在、社内の全員がGoogle BigQueryに保存されているデータセットにアクセスできます。各チームはサービスを自由に利用でき、ユースケースを文書化していません。あなたはデータウェアハウスのセキュリティ確保を依頼されました。全員が何をしているのかを把握する必要があります。まず何をすべきでしょうか?