Professional-Data-Engineer 試験問題 41

会社のオンプレミスのApacheHadoopサーバーはサポート終了に近づいており、IT部門はクラスターをGoogleCloudDataprocに移行することを決定しました。クラスタの同様の移行には、ノードごとに50TBのGoogle永続ディスクが必要になります。CIOは、それだけのブロックストレージを使用するコストを懸念しています。
移行のストレージコストを最小限に抑える必要があります。あなたは何をするべきか?
  • Professional-Data-Engineer 試験問題 42

    これらのうち、スパースベクトルの値の例はどれですか?(2つの答えを選択してください。)
  • Professional-Data-Engineer 試験問題 43

    MJTelcoのケーススタディ
    会社概要
    MJTelcoは、急速に成長し、サービスの行き届いていない市場でネットワークを構築することを計画している新興企業です。
    世界。同社は革新的な光通信ハードウェアの特許を取得しています。これらの特許に基づいて、
    安価なハードウェアを使用して、信頼性の高い高速バックボーンリンクを多数作成できます。
    会社背景
    経験豊富なテレコムエグゼクティブによって設立されたMJTelcoは、もともと
    宇宙での通信の課題を克服します。彼らの活動の基本である彼らは、
    リアルタイム分析を推進し、機械学習を組み込んだ分散データインフラストラクチャ
    トポロジを継続的に最適化します。彼らのハードウェアは安価であるため、彼らは
    動的な地域政治が場所の可用性に与える影響を説明できるネットワーク
    料金。
    彼らの管理および運用チームは世界中に配置され、多対多を生み出しています
    データコンシューマーとそのシステムで提供するものとの関係。慎重に検討した後、彼らは
    パブリッククラウドは、彼らのニーズをサポートするのに最適な環境であると判断しました。
    ソリューションコンセプト
    MJTelcoは、ラボで成功した概念実証(PoC)プロジェクトを実行しています。彼らには2つの主要なニーズがあります:
    PoCをスケーリングおよび強化して、より多くのデータフローにランプするときに生成される大幅に多くのデータフローをサポートします

    50,000以上のインストール。
    機械学習サイクルを改善して、制御に使用する動的モデルを検証および改善します

    トポロジー定義。
    MJTelcoは、開発/テスト、ステージング、本番の3つの別個の運用環境も使用します。
    -実験の実行、新機能の導入、本番環境の顧客へのサービス提供のニーズを満たすため。
    ビジネス要件
    最小限のコストで本番環境をスケールアップし、いつでもどこでもリソースをインスタンス化します

    予測不可能な分散型通信ユーザーコミュニティで必要とされています。
    独自のデータのセキュリティを確保して、最先端の機械学習と分析を保護します。

    分散した研究者からの分析のためのデータへの信頼できるタイムリーなアクセスを提供します

    機械学習モデルの迅速な反復をサポートする分離された環境を維持します。

    顧客に影響を与えます。
    技術要件
    テレメトリデータの安全で効率的な転送と保存を確保する

    インスタンスを迅速にスケーリングして、複数のフローを持つ10,000〜100,000のデータプロバイダーをサポート

    各。
    約2年間のデータを追跡するデータテーブルに対する分析とプレゼンテーションを可能にします

    1億レコード/日
    データパイプラインの問題の認識に焦点を合わせた監視インフラストラクチャの迅速な反復をサポートする

    テレメトリフローと本番学習サイクルの両方で。
    CEOの声明
    私たちのビジネスモデルは、特許、分析、動的な機械学習に依存しています。私たちの安価な
    ハードウェアは信頼性が高くなるように構成されているため、コスト面で有利です。早く安定させる必要があります
    信頼性と容量のコミットメントを満たすための大規模な分散データパイプライン。
    CTOステートメント
    当社のパブリッククラウドサービスは、宣伝どおりに動作する必要があります。データを拡張して維持するリソースが必要です
    安全。また、データサイエンティストが注意深く研究し、迅速に適応できる環境も必要です。
    モデル。データの処理は自動化に依存しているため、開発とテストも必要です
    反復しながら機能する環境。
    CFOステートメント
    プロジェクトが大きすぎて、データと分析に必要なハードウェアとソフトウェアを維持できません。
    また、非常に多くのデータフィードを監視するために運用チームにスタッフを配置する余裕がないため、
    自動化とインフラストラクチャ。Google Cloudの機械学習により、定量的研究者は次のことができるようになります。
    データパイプラインの問題ではなく、価値の高い問題に取り組みます。
    次の要件を持つ運用チームのビジュアライゼーションを作成する必要があります。
    レポートには、最も最近の6週間の50,000のインストールすべてからのテレメトリデータを含める必要があります

    (1分に1回のサンプリング)。
    レポートは、ライブデータから3時間以上遅れてはなりません。

    実用的なレポートには、次善のリンクのみを表示する必要があります。

    ほとんどの次善のリンクは上にソートする必要があります。

    最適ではないリンクは、地域の地理によってグループ化およびフィルタリングできます。

    レポートをロードするためのユーザーの応答時間は5秒未満である必要があります。

    どのアプローチが要件を満たしていますか?
  • Professional-Data-Engineer 試験問題 44

    テーブルの最初の3列のみに対する読み取り権限をユーザーに与えるには、どのアクセス制御方法を使用しますか?
  • Professional-Data-Engineer 試験問題 45

    Cloud Bigtableスキーマの行キーを設計する際の一般的な推奨事項は何ですか?