データの分割は、データセットの行を 2 つの異なるセットに分割します。
Azure Machine Learning Studio のデータの分割モジュールの相対式分割オプションは、数値式を使用してデータセットをトレーニング データセットとテスト データセットに分割する必要がある場合に役立ちます。
相対式分割:数値列に条件を適用したい場合、このオプションを使用します。数値は、日付/時刻フィールド、年齢や金額を含む列、あるいはパーセンテージなどです。例えば、データセットを商品の価格に応じて分割したり、年齢層ごとにグループ分けしたり、カレンダーの日付でデータを分割したりすることができます。
シナリオ:
ユーザーが広告に反応する傾向を判断する前に、ローカル市場セグメンテーション モデルが適用されます。
トレーニングデータと本番データ間の特徴の分布は一貫していません。参考文献:
https://docs.microsoft.com/en-us/azure/machine-learning/studio-module-reference/split-data
トピック1、ケーススタディ1
概要
あなたは、プロスポーツイベント向けのデータサイエンスサービスを提供する企業のデータサイエンティストです。以下のビジネス目標を達成するために、グローバルおよびローカルの市場データモデルを作成します。
*観客の反応の音声に基づいて、スポーツイベントでのモバイルデバイスユーザーの感情を理解します。
*広告に対するユーザーの反応傾向にアクセスします。
*モバイル デバイスに表示される広告のスタイルをカスタマイズします。
*ペナルティイベントを検出するにはビデオを使用します。
現在の環境
要件
* ペナルティイベントの検出に使用されるメディアは、一般向けデバイスから提供されます。メディアには、スポーツイベント中に撮影された画像や動画、ソーシャルメディアで収集された画像や動画が含まれる場合があります。画像や動画のサイズや形式は様々です。
* モデル構築に利用可能なデータは、7年間のスポーツイベントメディアから構成されています。スポーツイベントメディアには、録画されたビデオ、ラジオ実況の書き起こし、スポーツイベント中にキャプチャされた関連ソーシャルメディアフィードのログが含まれます。
*観客の感情には、イベント参加者が提出したモノラルとステレオの両方の形式の音声録音が含まれます。
広告
* 広告応答モデルは各イベントの開始時にトレーニングされ、スポーツイベント中に適用する必要があります。
* 市場セグメンテーション ネクセルは、類似の広告レスポンス履歴に合わせて最適化する必要があります。
* サンプリングでは、同じ機能を共有するローカルおよびグローバルのセグメンテーション モデルの相互および集合的な排他性を保証する必要があります。
* ユーザーの広告への反応傾向を判断する前に、ローカル市場セグメンテーション モデルが適用されます。
* データ サイエンティストは、モデルの劣化と劣化を検出できる必要があります。
* 広告応答モデルは非線形境界機能をサポートする必要があります。
* 広告傾向モデルはカット閾値0.45を使用し、加重カッパが0.1から逸脱すると再トレーニングが発生します。
+/-5%。
* 広告傾向モデルでは、次の図に示すコスト要因を使用します。

広告傾向モデルでは、次の図に示す提案されたコスト要因が使用されます。

現在のコスト要因シナリオと提案されたコスト要因シナリオのパフォーマンス曲線を次の図に示します。

ペナルティ検出と感情
調査結果
*データ サイエンティストは、ペナルティ イベントの検出に複数の機械学習モデルを使用して、インテリジェントなソリューションを構築する必要があります。
*データ サイエンティストは、機械学習パイプラインの自動機能エンジニアリングとモデル構築を使用して、ローカル環境でノートブックを構築する必要があります。
*動的ワーカー割り当てを備えた Spark インスタンスを使用して再トレーニングするには、ノートブックをデプロイする必要があります。
* データのソースのみを再コードするには、ノートブックを新しい Spark インスタンスで同じコードで実行する必要があります。
*グローバル ペナルティ検出モデルは、トレーニング中に動的ランタイム グラフ計算を使用してトレーニングする必要があります。
*ローカルペナルティ検出モデルは、BrainScript を使用して記述する必要があります。
* ローカル群衆感情モデルの実験では、ローカルペナルティ検出データを組み合わせる必要があります。
* 群衆感情モデルは、歓声やキャッチフレーズといった既知の音を識別する必要があります。個々の群衆感情モデルは、類似した音を検出します。
* ローカル モデルのすべての共有機能は連続変数です。
* 共有フィーチャは倍精度を使用する必要があります。後続レイヤーには、集計移動平均と標準偏差のメトリクスが必要です。
セグメント
生産開始から数週間の間に、次のようなことが観察されました。
※広告の反応率が低下しました。
*ドロップは広告スタイル間で一貫していませんでした。
*トレーニング データと本番データ間の特徴の分布は一貫していません。
分析の結果、ユーザーの位置情報と行動に関する100個の数値特徴量のうち、位置情報源から得られる47個の特徴量が生の特徴量として使用されていることが分かりました。バイアスと分散の問題を解決するための提案された実験として、線形補正されていない特徴量を10個作成することが挙げられます。
ペナルティ検出と感情
*初期データ検出では、群衆感情モデルに使用されるトレーニング データ内のターゲット状態の密度が広範囲にわたっていることがわかります。
*すべてのペナルティ検出モデルでは、確率的勾配降下法 (SGD) を使用した推論フェーズが過度に実行されていることを示しています。
*音声サンプルでは、キャッチフレーズの長さは地域によって25%~47%異なることが示されています。
*グローバルペナルティ検出モデルのパフォーマンスは、トレーニングセットと検証セットを比較すると、分散は低いもののバイアスは高いことが示されています。特徴量の変更を実装する前に、すべてのトレーニングケースと検証ケースを用いてバイアスと分散を確認する必要があります。