数字が増えるほど、顧客が見えなくなることがあります。

PV、セッション、滞在時間、クリック率、コンバージョン率。ダッシュボードには、数えられるものが整然と並びます。ところが、きれいに測れることと、知る価値があることは同じではありません。

数えられるものすべてが重要とは限らない。
重要なものすべてを数えられるとも限らない。

Not everything that can be counted counts,
and not everything that counts can be counted.

実は、アインシュタインの言葉ではなかった

この言葉は長くアインシュタインの発言として紹介され、このサイトでも2010年の初出時にそう記しました。しかし、現在確認できる最も早い確かな出典は、社会学者William Bruce Cameronの1963年の著書『Informal Sociology』です。引用元を訂正します。

同書の「Knowledge Without Numbers」という章でCameronが問い直したのは、数字そのものではありません。社会学に必要な情報をすべて列挙し、当時のIBMの機械へ通して図表化できれば簡単だが、現実はそうではない、という文脈でした。数値化できるものだけで、人間を理解したつもりになる態度への警告です。

当時のIBMをAIに置き換えると、問いは古びるどころか深刻になっています。処理できるデータが増えても、何が重要なのかまで機械が決めてくれるわけではありません。

数えられるものだけを見ると、重要なものを見落とす

本来、指標は目的へ近づいているかを確かめるための代理変数です。ところが運用を続けるうちに、代理だった数字そのものが目的へ変わります。

測りやすい数字 数字だけでは分からないこと
PV 読みたい内容が見つかり、理解が進んだか
滞在時間 興味を持って読んだのか、迷って動けなかったのか
クリック率 納得して選んだのか、誤解を招く表現に反応したのか
コンバージョン率 本人の目的が達成され、その後も満足したか
レポート作成時間 判断や顧客体験が良くなったか

この段階で起きているのは、観測の偏りです。測りやすいものだけを見ているうちに、測りにくい理解、納得、迷い、信頼が判断から消えていきます。

指標を目標にすると、数字が行動を変え始める

さらに、指標を目標として評価や報酬へ結びつけると、人は数字に合わせて行動を変えます。

PVを目標にすれば、ページを分割して表示回数を増やせます。クリック率を目標にすれば、強い表現で注意を引けます。CV率を目標にすれば、判断に必要な情報を省き、決断を急がせることもできます。数字は改善しても、体験や信頼まで良くなったとは限りません。

問題は数字が不正確なことではありません。正確に測れた別のものを、本来の目的だと思い込むことです。

この転倒には名前も付いています。経済学者Charles Goodhartは、1975年にReserve Bank of Australiaの会議で発表した「Problems of Monetary Management: The U.K. Experience」で、政策目標に使われた統計的な規則性は崩れると、金融政策の文脈で指摘しました。改訂版は1976年の論文集に収録され、RBAの公式文献目録では、後に「Goodhart's Law」と呼ばれる最初の言及だと説明されています。

人類学者Marilyn Strathernは1997年の論文「‘Improving ratings’: audit in the British University system」で、Hoskinによる簡潔な言い換えとして「指標が目標になると、良い指標であることをやめる」と紹介しました。現在、KPI運用でもグッドハートの法則として知られる構造です。

CameronとGoodhartは、似ているようで別の問題を示しています。

問い 起きること
Cameron:数えられるものは、重要なものか 数えやすいものだけを見て、重要なものを見落とす
Goodhart:指標を目標にすると、何が起きるか 人が数字へ適応し、指標と本来の目的の関係が壊れる

KPIを決める前に、壊れ方を考えよう

指標をなくす必要はありません。目標として運用する前に、その数字がどのように攻略され、何を見えなくするかを考えます。

  1. この数字は、人に起きてほしい何の変化を代弁しているか
  2. 本来の変化を起こさず、数字だけを上げる方法はないか
  3. 数字が上がることで、誰かに不利益が生じないか
  4. 数字と一緒に、どの反証や本人の声を確認するか
  5. 数字が変わったとき、実際に何の判断を変えるのか

例えば、資料請求のCV率を上げることだけを目標にすると、比較に必要な情報や注意点を省き、決断を急がせるページも「成果が高い」と評価されます。しかし、本来起きてほしいのは、本人が選択肢を理解し、自分に合う判断をすることです。

CV率だけでなく、その後の取り消し、問い合わせ、継続利用、再訪、本人の声も確認すれば、フォームの数字ではなく、選択までの体験を改善できます。指標は答えではなく、次に何を確かめ、何を変えるかを考えるための証拠です。

成果ではなく、人間を理解する

では、何を測ればよいのでしょうか。ツールに用意された指標から選ぶのをやめ、次の順で逆引きします。

  1. その人は、何をしようとしていたのか
  2. どのような状況にあり、何に迷っていたのか
  3. 接点を通して、理解、感情、選択、関係がどう変わってほしいのか
  4. 何が分かれば、企業の次の判断を変えられるのか

売上やコンバージョンは大切です。ただし、それは人に起きた変化の結果です。結果だけを集計しても、なぜ選ばれたのか、誰の役に立たなかったのか、次に何を変えるべきかは分かりません。

この考えを具体的な計測へ落とした例が、ASCII.jpで連載した「その指標がデザインを決める」です。ゴールのないサイトでもコンバージョンを測る方法では、取得できる数字ではなく「訪れた人にどうなってもらいたいか」から指標を組み立てました。現在の言葉で整理し直したものが、PDCAからBMLへの記事です。

数えられないから、諦めるのではない

「大切なことは測れない」で終えると、経験や声の大きさで判断する仕事へ戻ってしまいます。完全には数えられなくても、理解を深める証拠は集められます。

  • 行動データで、どこに違いが起きているかを見つける
  • 検索語や問い合わせで、本人が使った言葉を読む
  • インタビューや観察で、目的、事情、迷いを知る
  • CRMや継続利用で、一回の訪問後に関係がどう変わったかを確かめる
  • 複数の証拠が一致するか、反証となる事例がないかを探す

一人を追跡し尽くす必要はありません。同意を得て観測できる行動、集団の傾向、本人の声を組み合わせ、事実、解釈、仮説を分けて扱います。数字を捨てるのではなく、数字を人間の文脈へ戻すのです。

AIで数える前に、人が問う

AIは、自由記述や検索語の分類、パターンの探索、仮説の列挙を速くします。一方で、目的の曖昧なデータを渡せば、もっともらしい要約と指標をいくらでも増やせます。レポート作成が速くなっても、見るべきものを間違えていれば、間違った方向へ速く進むだけです。

AIの評価も同じです。ベンチマークの点数だけを競わせると、利用者に役立つことより、決められたテストで点を取ることへ最適化されます。実際に、説明可能性を測るNLPの評価指標にもGoodhartの法則が当てはまるという研究があります。AIに評価を任せれば客観的になる、とは限りません。

何を知れば判断が変わるのか。誰にどのような変化が起きるべきか。その変化は本人にとっても望ましいのか。ここは人が引き受けるしかありません。

測れるものを増やす前に、何が重要なのかを決める。取れる数字から始めず、人に起きてほしい変化から計測を設計しよう。