Professional-Data-Engineer 試験問題 166
データがパイプラインに入った時間に基づいて、無制限のデータソースのデータを1時間ごとに集約するために、どのクラウドデータフロー/ビーム機能を使用する必要がありますか?
Professional-Data-Engineer 試験問題 167
あなたの会社は1時間に20,000個のファイルを作成しています。各データファイルは、4 KB未満のコンマ区切り値(CSV)ファイルとしてフォーマットされます。すべてのファイルは、処理する前にGoogleCloudPlatformに取り込む必要があります。会社のサイトはGoogleCloudに対して200ミリ秒の遅延があり、インターネット接続の帯域幅は50Mbpsに制限されています。現在、データ取り込みポイントとして、Google Compute Engineの仮想マシンにセキュアFTP(SFTP)サーバーをデプロイしています。ローカルSFTPクライアントは専用マシンで実行され、CSVファイルをそのまま送信します。目標は、前日のデータを含むレポートを毎日午前10時までに経営幹部が利用できるようにすることです。この設計では、帯域幅の使用率はかなり低くなりますが、現在のボリュームにほとんど追いつくことができません。季節性のため、あなたの会社は、今後3か月でファイル数が2倍になると予想しています。あなたはどちらの2つの行動を取るべきですか?(2つ選択してください。)
Professional-Data-Engineer 試験問題 168
あなたは、ApacheHadoopクラスターで実行する会社のETLパイプラインを作成する責任があります。The
パイプラインには、いくつかのチェックポイントと分割のパイプラインが必要になります。を書くためにどの方法を使うべきか
パイプライン?
パイプラインには、いくつかのチェックポイントと分割のパイプラインが必要になります。を書くためにどの方法を使うべきか
パイプライン?
Professional-Data-Engineer 試験問題 169
あなたの会社は、多数のニューロンとレイヤーを備えたTensorFlowニュートラルネットワークモデルを構築しました。モデルはトレーニングデータによく適合します。ただし、新しいデータに対してテストすると、パフォーマンスが低下します。これに対処するためにどのような方法を採用できますか?
Professional-Data-Engineer 試験問題 170
あなたの会社は、多数のニューロンとレイヤーを備えたTensorFlowニュートラルネットワークモデルを構築しました。モデルはトレーニングデータによく適合します。ただし、新しいデータに対してテストすると、パフォーマンスが低下します。これに対処するためにどのような方法を採用できますか?
