Professional-Data-Engineer 試験問題 41
あなたの会社は、カンマ区切り値 (CSV) ファイルを Google BigQuery にロードしています。データは完全に正常にインポートされました。ただし、インポートされたデータはソース ファイルとバイトごとに一致しません。この問題の最も考えられる原因は何ですか?
Professional-Data-Engineer 試験問題 42
あなたの会社は、Google Cloud Dataflow で学習アルゴリズムのデータ前処理を実行しています。
このステップ中に多数のデータ ログが生成されており、チームはそれらを分析したいと考えています。キャンペーンの動的な性質により、データは時間ごとに指数関数的に増加しています。
データ サイエンティストは、ログ内の新しい重要な機能のデータを読み取るために次のコードを作成しました。
BigQueryIO.Read
.named("ReadLogData")
.from("clouddataflow-readonly:samples.log_data")
このデータ読み取りのパフォーマンスを向上させたいと考えています。あなたは何をするべきか?
このステップ中に多数のデータ ログが生成されており、チームはそれらを分析したいと考えています。キャンペーンの動的な性質により、データは時間ごとに指数関数的に増加しています。
データ サイエンティストは、ログ内の新しい重要な機能のデータを読み取るために次のコードを作成しました。
BigQueryIO.Read
.named("ReadLogData")
.from("clouddataflow-readonly:samples.log_data")
このデータ読み取りのパフォーマンスを向上させたいと考えています。あなたは何をするべきか?
Professional-Data-Engineer 試験問題 43
データセットに個人の行と、誕生年、国、収入の列が含まれている場合、連続列はいくつあり、カテゴリ列はいくつありますか?
Professional-Data-Engineer 試験問題 44
Cloud Bigtable に依存するパフォーマンス テストを実行している場合は、以下の 1 つを除くすべての選択肢が推奨される手順です。推奨されない手順はどれですか?
Professional-Data-Engineer 試験問題 45
次の条件を満たすクラウドネイティブな履歴データ処理システムを設計しています。
* 分析されるデータは CSV、Avro、PDF 形式であり、Cloud Dataproc、BigQuery、Compute Engine などの複数の分析ツールによってアクセスされます。
* ストリーミング データ パイプラインは、毎日新しいデータを保存します。
* パフォーマンスはソリューションの要素ではありません。
* ソリューション設計では、可用性を最大化する必要があります。
このソリューションのデータ ストレージをどのように設計すべきでしょうか?
* 分析されるデータは CSV、Avro、PDF 形式であり、Cloud Dataproc、BigQuery、Compute Engine などの複数の分析ツールによってアクセスされます。
* ストリーミング データ パイプラインは、毎日新しいデータを保存します。
* パフォーマンスはソリューションの要素ではありません。
* ソリューション設計では、可用性を最大化する必要があります。
このソリューションのデータ ストレージをどのように設計すべきでしょうか?

