Professional-Data-Engineer 試験問題 26
地震データを分析するシステムを設計しています。抽出、変換、ロード(ETL)プロセスは、Apache Hadoop クラスター上で一連の MapReduce ジョブとして実行されます。ETL プロセスでは、一部のステップの計算コストが高いため、データセットの処理に数日かかります。その後、センサーのキャリブレーションステップが省略されていることが判明しました。将来的にセンサーのキャリブレーションを体系的に実行するために、ETL プロセスをどのように変更すればよいでしょうか。
Professional-Data-Engineer 試験問題 27
次の条件を満たすクラウドネイティブの履歴データ処理システムを設計しています。
* 分析対象のデータは CSV、Avro、PDF 形式で、Cloud Dataproc、BigQuery、Compute Engine などの複数の分析ツールからアクセスされます。
* ストリーミング データ パイプラインは毎日新しいデータを保存します。
* パフォーマンスはソリューションの要素ではありません。
* ソリューション設計では可用性を最大化する必要があります。
このソリューションのデータストレージをどのように設計すればよいでしょうか?
* 分析対象のデータは CSV、Avro、PDF 形式で、Cloud Dataproc、BigQuery、Compute Engine などの複数の分析ツールからアクセスされます。
* ストリーミング データ パイプラインは毎日新しいデータを保存します。
* パフォーマンスはソリューションの要素ではありません。
* ソリューション設計では可用性を最大化する必要があります。
このソリューションのデータストレージをどのように設計すればよいでしょうか?
Professional-Data-Engineer 試験問題 28
大手不動産会社で勤務しており、機械学習に使用する6TBの住宅販売データを準備しています。SQLを使用してデータを変換し、BigQuery MLを使用して機械学習モデルを作成します。このモデルを使用して、変換されていない生のデータセットに対する予測を行う予定です。予測時の偏りを防ぐために、ワークフローをどのように設定すればよいでしょうか?
Professional-Data-Engineer 試験問題 29
貴社では、WHILECARDテーブルを使用して、類似した名前を持つ複数のテーブルにまたがるデータクエリを実行しています。現在、SQL文が以下のエラーで失敗しています。
# 構文エラー: 文の終わりを期待しましたが、[4:11] で "-" を取得しました
年齢を選択
から
bigquery-public-data.noaa_gsod.gsod
どこ
年齢 != 99
AND_TABLE_SUFFIX = '1929'
注文方法
年齢 DESC
どのテーブル名で SQL ステートメントが正しく機能しますか?
# 構文エラー: 文の終わりを期待しましたが、[4:11] で "-" を取得しました
年齢を選択
から
bigquery-public-data.noaa_gsod.gsod
どこ
年齢 != 99
AND_TABLE_SUFFIX = '1929'
注文方法
年齢 DESC
どのテーブル名で SQL ステートメントが正しく機能しますか?
Professional-Data-Engineer 試験問題 30
あなたのスタートアップでは、正式なセキュリティポリシーを一度も導入したことがありません。現在、社内の全員がGoogle BigQueryに保存されているデータセットにアクセスできます。各チームはサービスを自由に利用でき、ユースケースを文書化していません。あなたはデータウェアハウスのセキュリティ確保を依頼されました。全員が何をしているのかを把握する必要があります。まず何をすべきでしょうか?

