片側または両側のテストを選択します。デフォルトは両側テストです。これは最も一般的なタイプのテストであり、予想される分布はゼロを中心に対称です。
例:相関の関数としての対応のない2標本t検定と対応のある2標本t検定のタイプIエラー。シミュレートされたランダム数は、分散が1の2変量正規分布に由来します。

参照:
https://docs.microsoft.com/en-us/azure/machine-learning/studio-module-reference/test-hypothesis-using-t-test
https://en.wikipedia.org/wiki/Student%27s_t-test
モデルを開発する
テストレット1
ケーススタディ
概要
あなたは、プロのスポーツイベントにデータサイエンスを提供する会社のデータサイエンティストです。モデルは、グローバルおよびローカルの市場データを使用して、次のビジネス目標を達成します。
*群衆の反応からの音声に基づいて、スポーツイベントでのモバイルデバイスユーザーの感情を理解します。
*広告に反応するユーザーの傾向を評価します。
*モバイルデバイスに配信される広告のスタイルをカスタマイズします。
*ペナルティイベントを検出するためにビデオを使用する
現在の環境
*ペナルティイベントの検出に使用されるメディアは、消費者向けデバイスによって提供されます。メディアには、スポーツイベント中にキャプチャされ、ソーシャルメディアを使用して共有される画像やビデオが含まれる場合があります。画像と動画のサイズと形式はさまざまです。
*モデル構築に利用できるデータは、7年間のスポーツイベントメディアで構成されています。スポーツイベントメディアには以下が含まれます。記録されたビデオトランスクリプトまたはラジオ解説、およびスポーツイベント中にキャプチャされた関連するソーシャルメディアフィードからのログ。
*群衆の感情には、モノラル形式とステレオ形式の両方でイベント参加者から提出されたオーディオ録音が含まれます。
ペナルティの検出と感情
*データサイエンティストは、ペナルティイベントの検出に複数の機械学習モデルを使用してインテリジェントなソリューションを構築する必要があります。
*データサイエンティストは、機械学習パイプラインでの自動特徴エンジニアリングとモデル構築を使用して、ローカル環境でノートブックを構築する必要があります。
*動的なワーカー割り当てを備えたSparkインスタンスを使用して再トレーニングするには、ノートブックをデプロイする必要があります。
*ノートブックは、データのソースのみを再コード化するために、新しいSparkインスタンスで同じコードで実行する必要があります。
*グローバルペナルティ検出モデルは、トレーニング中に動的ランタイムグラフ計算を使用してトレーニングする必要があります。
*ローカルペナルティ検出モデルは、BrainScriptを使用して作成する必要があります。
*地域の群衆感情モデルの実験では、地域のペナルティ検出データを組み合わせる必要があります。
*群衆の感情モデルは、歓声や既知のキャッチフレーズなどの既知の音を識別する必要があります。個々の群衆感情モデルは、同様の音を検出します。
*ローカルモデルのすべての共有機能は連続変数です。
*共有機能は倍精度を使用する必要があります。後続のレイヤーには、実行中の平均と標準偏差の合計メトリックが使用可能である必要があります。
広告
生産の最初の数週間で、次のことが観察されました。
*評価された広告の回答は減少しました。
*ドロップは広告スタイル間で一貫していませんでした。
*トレーニングデータと本番データ全体での機能の分布に一貫性がない分析によると、ユーザーの場所と行動に関する100の数値機能のうち、場所ソースからの47の機能が未加工の機能として使用されています。偏りと分散の問題を解決するために推奨される実験は、10個の線形無相関の特徴を設計することです。
*最初のデータ検出では、群集感情モデルに使用されるトレーニングデータに、ターゲット状態の密度が広範囲にわたって示されています。
*すべてのペナルティ検出モデルは、確率的勾配降下法(SGD)を使用した推論フェーズの実行が遅すぎることを示しています。
*オーディオサンプルは、キャッチフレーズの長さが地域によって25%〜47%の間で変化することを示しています
*グローバルペナルティ検出モデルのパフォーマンスは、トレーニングセットと検証セットを比較すると、分散は低くなりますが、バイアスが高くなります。機能の変更を実装する前に、すべてのトレーニングと検証のケースを使用してバイアスと分散を確認する必要があります。
*広告応答モデルは、各イベントの開始時にトレーニングし、スポーツイベント中に適用する必要があります。
*マーケットセグメンテーションモデルは、同様の広告応答履歴に合わせて最適化する必要があります。
*サンプリングは、同じ機能を共有するローカルセグメンテーションモデルとグローバルセグメンテーションモデルの間で排他的に相互および集合を保証する必要があります。
*広告に応答するユーザーの傾向を判断する前に、ローカルマーケットセグメンテーションモデルが適用されます。
*広告応答モデルは、機能の非線形境界をサポートする必要があります。
*広告傾向モデルはカットしきい値が0.45であり、加重カッパがから逸脱した場合に再トレーニングが発生します。
0.1 +/- 5%。
*広告傾向モデルは、次の図に示すコスト係数を使用します。

*広告傾向モデルは、次の図に示す提案されたコスト要因を使用します。

*現在および提案されているコスト要因シナリオのパフォーマンス曲線を次の図に示します。
