記事

記述統計とは何ですか?高度分析101

ペタバイトをパフォーマンスに変える:エンタープライズインテリジェンスのエンジン

記述統計学は、データセットの主要な特徴を要約し記述し、それ以上の結論を導き出さずに記述する統計学の一分野です。大量の生記録を中心傾向、分散、分布形状(平均、中央値、標準偏差、パーセンタイル)の指標に凝縮し、チームはモデリング前にデータセットの実質を把握できます。

記述統計には主に3つのタイプがあります。1. 中心傾向の指標(平均値、中央値、モード)が代表値を特定する。2. 分散の指標(範囲、分散、標準偏差、四分位範囲)は、その中心からどれだけ広がっているかを示します。3. 位置と頻度の指標(パーセンタイル、四分位、頻度分布、歪度、尖峰)は、値が順序集合内でどこに位置するかや分布の形状を示します。

記述的統計の主な目的は、直感を証拠に置き換えることです。運用データを安定したベースラインにまとめることで、リーダーはパフォーマンスのベンチマーク、複合的不一致の検出、報告やAIモデルに届く前のデータ品質の監査が可能になります。それは、下流のすべてが信頼できるかどうかを決定する品質ゲートです。

企業の記述統計の例としては、小売業の平均注文額と返品率、医療分野の再入院率と治療期間、金融サービスにおける取引量とクレジットスコア分布、製造における部品公差や出荷リードタイムなどがあります。それぞれはサンプルではなく、全記録母集団にわたって計算される要約指標です。

記述統計は、実際に持つデータを整理・要約し、それ以上の主張をしません。推論統計はサンプルを取り、確率論を用いてより広い集団について結論を導き出し、信頼度を明示した推定値を導きます。記述統計は何が起こったのかを答えます。推論統計は他の場所で真実である可能性を推定します。

Teradata Cloudは、Teradata Databaseのデータベース内解析機能を通じて要約関数を実行し、データを抽出するのではなく、すでに存在する場所で計算を実行します。大規模並列処理は、アクティブ計算または弾力計算を用いて数十億行にわたる単変量の要約、頻度分布、分散、相関行列を計算し、出口コストや追加の攻撃面なしに計算します。

最新情報をお受け取りください

メールアドレスをご登録ください。ブログの最新情報をお届けします。



テラデータはソリューションやセミナーに関する最新情報をメールにてご案内する場合があります。 なお、お送りするメールにあるリンクからいつでも配信停止できます。 以上をご理解・ご同意いただける場合には「はい」を選択ください。

テラデータはお客様の個人情報を、Teradata Global Privacy Statementに従って適切に管理します。