対決、ビッグデータ 対 サンプリング

執筆者:

カテゴリ:

Dsc_1065shadow
IT業界ではBigDataがバズワード化していますね。
IDCも第三のプラットフォームを提唱しその中でビッグデータを取り上げています。
先日読んだ本「統計学は最強の学問か?」でもビッグデータのことにも言及しており、全件探索に意味があるのか?サンプリングし統計処理すればそれでいいのではないかと、書かれていました。
読んでいたときには、「ふーん」だったのですが、頭のどこかに引っかかっていたのでしょう、ふと、ビッグデータ+サンプリングのキーワードでGoogle検索してみたくなり、検索してみると、33万件ヒット.中には、確かに、おもしろいWebもありました。
・データの特性のみに注目した問題設定
・ビッグデータはバズワードか?
・ASCII.jp:“統計の基礎を無視している”Hadoop使いが考えるビッグデータ
・言いたいことはわかる。世の中の無根拠な「ビッグデータ」翼賛のマスコミ
・ビッグデータが“バズワード”から脱せない背景
・ビッグデータを活かせるか?
特に、一番目の宇野さんのPDFを読んでいて、大きいことは良いことなのか?
BigDataは伝統的な統計学は違う、と目覚めました。
Bigdataでやりたいことは、データの固まりを一つに束ね、全体傾向を知り、起こってしまったことを理解したいのではないでしょう。それならば、ランダムサンプリングし伝統的な統計処理に任せればいいです。いわゆるバッチ処理で十分。警視庁捜査一課のエリート集団が捜査本部をたてるような感じですかね。
BigDataでなければできないことは、データがノイズであろうとなかろうと、偏っていようがいまいが、すべてのデータを分類し、クラスタを見つけ、その各クラスタにどんな特性があり、各クラスタが将来どのように動いていくのかを知るために、データを一件一件、しらみつぶしに捜していく、所轄のデカさん的なマイニングにある気がしてきました。
大量のデータを蓄積することと高速に処理することが可能になった今のITのパワーによって、所轄の大きさが限りなく拡大したということでしょうか?

コメント

コメントを残す

メールアドレスが公開されることはありません。 が付いている欄は必須項目です