Professional-Data-Engineer 試験問題 156

最近の価格履歴に基づいて特定の株式の価格を予測する機械学習モデルを作成する場合、どのタイプの推定量を使用する必要がありますか?
  • Professional-Data-Engineer 試験問題 157

    スパム分類器をトレーニングしています。トレーニングデータを過剰適合していることに気づきました
    a。この問題を解決するために実行できる3つのアクションはどれですか。(3つ選択してください。)
  • Professional-Data-Engineer 試験問題 158

    ケーススタディ:2-MJTelco
    会社概要
    MJTelcoは、世界中で急速に成長し、サービスが行き届いていない市場でネットワークを構築することを計画している新興企業です。同社は革新的な光通信ハードウェアの特許を取得しています。これらの特許に基づいて、安価なハードウェアで多くの信頼性の高い高速バックボーンリンクを作成できます。
    会社背景
    経験豊富なテレコムエグゼクティブによって設立されたMJTelcoは、宇宙での通信の課題を克服するために元々開発されたテクノロジーを使用しています。運用の基本として、リアルタイム分析を推進し、トポロジを継続的に最適化するための機械学習を組み込んだ分散データインフラストラクチャを作成する必要があります。彼らのハードウェアは安価であるため、ネットワークを過剰に展開して、動的な地域政治が場所の可用性とコストに与える影響を考慮できるようにすることを計画しています。彼らの管理および運用チームは世界中に配置されており、データ利用者とシステムで提供するものとの間に多対多の関係を築いています。慎重に検討した結果、彼らはパブリッククラウドが彼らのニーズをサポートするのに最適な環境であると判断しました。
    ソリューションコンセプト
    MJTelcoは、ラボで成功した概念実証(PoC)プロジェクトを実行しています。彼らには2つの主要なニーズがあります:
    PoCをスケーリングおよび強化して、50,000を超えるインストールにランプするときに生成される大幅に多くのデータフローをサポートします。
    機械学習サイクルを改善して、トポロジ定義の制御に使用する動的モデルを検証および改善します。
    MJTelcoは、開発/テスト、ステージング、本番の3つの別々の運用環境も使用します。
    実験の実行、新機能の導入、本番環境の顧客へのサービス提供のニーズを満たすため。
    ビジネス要件
    最小限のコストで本番環境をスケールアップし、予測不可能な分散型テレコムユーザーコミュニティで必要なときに必要な場所でリソースをインスタンス化します。独自のデータのセキュリティを確保して、最先端の機械学習と分析を保護します。
    分散した研究者からの分析のためのデータへの信頼できるタイムリーなアクセスを提供します。顧客に影響を与えることなく、機械学習モデルの迅速な反復をサポートする隔離された環境を維持します。
    技術要件
    テレメトリデータの安全で効率的な転送と保存を保証するインスタンスを迅速にスケーリングして、それぞれ複数のフローを持つ10,000〜100,000のデータプロバイダーをサポートします。
    約2年間のデータを追跡するデータテーブルに対する分析とプレゼンテーションを可能にします
    1億レコード/日
    テレメトリフローと本番学習サイクルの両方でのデータパイプラインの問題の認識に焦点を当てた監視インフラストラクチャの迅速な反復をサポートします。
    CEOの声明
    私たちのビジネスモデルは、特許、分析、動的な機械学習に依存しています。当社の安価なハードウェアは信頼性が高くなるように構成されているため、コスト面で有利です。信頼性と容量のコミットメントを満たすには、大規模な分散データパイプラインを迅速に安定させる必要があります。
    CTOステートメント
    当社のパブリッククラウドサービスは、宣伝どおりに動作する必要があります。データを拡張して安全に保つためのリソースが必要です。また、データサイエンティストがモデルを注意深く研究し、迅速に適応できる環境も必要です。データの処理は自動化に依存しているため、反復しながら機能する開発環境とテスト環境も必要です。
    CFOステートメント
    プロジェクトが大きすぎて、データと分析に必要なハードウェアとソフトウェアを維持できません。
    また、非常に多くのデータフィードを監視するために運用チームにスタッフを配置する余裕がないため、自動化とインフラストラクチャに依存します。Google Cloudの機械学習により、定量的研究者は、データパイプラインの問題ではなく、価値の高い問題に取り組むことができます。
    MJTelcoが1日あたりの取り込みに関心を持っているレコードストリームを考えると、GoogleBigQueryのコストが増加することを懸念しています。MJTelcoは、設計ソリューションを提供するように依頼します。それらには、tracking_tableと呼ばれる単一の大きなデータテーブルが必要です。さらに、毎日のイベントの詳細な分析を実行しながら、毎日のクエリのコストを最小限に抑えたいと考えています。また、ストリーミング取り込みを使用したいと考えています。あなたは何をするべきか?
  • Professional-Data-Engineer 試験問題 159

    ソーシャルメディアの投稿をGoogleBigQueryに保存し、ほぼリアルタイムで1分あたり10,000メッセージの割合で分析する必要があります。最初に、個々の投稿にストリーミング挿入を使用するようにアプリケーションを設計します。アプリケーションは、ストリーミング挿入の直後にデータ集約も実行します。ストリーミング挿入後のクエリは強い一貫性を示さず、クエリからのレポートは処理中のデータを見逃す可能性があることがわかりました。アプリケーションの設計をどのように調整できますか?
  • Professional-Data-Engineer 試験問題 160

    あなたは40万人以上の従業員を抱える大規模なファーストフードレストランチェーンで働いています。従業員情報は、FirstNamefieldとLastNamefieldで構成されるユーザーテーブルのGoogleBigQueryに保存します。ITのメンバーがアプリケーションを構築していて、BigQueryのスキーマとデータを変更して、アプリケーションがスペースと連結されたFirstNamefieldの値とそれに続く各従業員のLastNamefieldの値で構成されるFullNamefieldをクエリできるようにするように求めています。コストを最小限に抑えながら、どのようにしてそのデータを利用できるようにすることができますか?