AIの基礎 入門

チューリングテストTuring Test

対話だけを見て人か機械かを言い当てる試験

ポイント
  • チューリングテストは対話だけを見て相手が人か機械かを言い当てる試験です。審査員が見分けられなければ、機械が合格したとみなします。
  • 測っているのは賢さではなく見分けが付かないことです。機械が何を理解しているかは、この試験ではわかりません。
  • 「考えるとは何か」という答えの出ない問いを、目で確かめられる問いに置き換えたところに、この試験の値打ちがあります。
  • 条件をどう定めるかで結果が大きく変わるため、今のAI開発では性能の基準としてはあまり使われません。
  • それでも表面上は人のように見えることと、実際に知っていることは違うという問いは、今のほうがずっと重くなっています。
目次

1たとえで理解する

オーディション会場に厚い衝立が立てられています。審査員は舞台に誰が立っているか見えず、聞こえてくる声だけを聞きます。顔も名前も経歴も隠されているので、判断できるのは衝立の向こうから届いたものだけです。

チューリングテストがこのオーディションです。審査員の席には人が座り、衝立の向こうには人が一人と機械が一台います。審査員は文字だけで質問を投げかけ、返ってきた答えを読んだあと、どちらが機械かを選びます。機械が十分な割合で人に選ばれれば合格です。ここで見分けようとしているのは、どちらが本当に歌が上手いかではありません。衝立越しに人らしく聞こえるかどうか、それだけです。

2くわしく

衝立の向こうで起きること

試験の規則は単純です。審査員は二人の相手と文字だけでやり取りします。声も見た目も、反応の速さの癖もすべて隠されます。どんな質問をしてもよく、罠を仕掛けてもよく、言い方を変えて聞き返してもかまいません。

決められた時間が過ぎると、審査員はどちらが機械かを指名します。複数の審査員が何度も判定して、機械を人だと勘違いする割合が十分高ければ、その機械は試験を超えたとみなします。判定の根拠はただ交わされた文字だけです。

何を測り、何を測らないか

この試験は相手の中身を覗きません。答えがどう作られたか、本当に意味をわかって話しているかは問いません。表に出たものだけを見て判定するという原則が、この試験の骨組みです。

もともとこの問いは「機械は考えられるか」でした。ですが、考えるとは何かということ自体、人によって答えが違うので議論が堂々巡りになりました。そこで問いそのものを置き換えました。確かめようのない問いの代わりに、確かめられる問いを置いたのです。代わりに代償も払いました。この試験を超えたという事実は、理解していたという証拠にはなってくれません。

真似がうまいほうへ傾きます

衝立越しの審査には妙な性質があります。正直に答えるほどかえって機械だと見破られやすいのです。難しい計算を瞬時に正しく答えると人らしくなく、わからないことをわからないとはっきり言っても人らしくありません。

だからこの試験を狙うと、わざと誤字を出し、計算を間違え、話をそらすほうが有利になります。試験が能力を伸ばす代わりに、真似の腕を伸ばす方向へ押しやってしまうわけです。この点は昔から指摘されてきた弱点です。

今はなぜ基準としてあまり使われないか

最近のAI評価では、項目を細かく分けます。問題を解く能力、長い文を読んで根拠を見つける能力、誤った答えを自分で気づく能力を、それぞれ別々に測ります。どこが強くてどこが弱いかを知らないと直せないからです。

衝立越しの審査はこれらすべてを一つにまとめて一度に判定します。合格したという結果だけが残り、何が足りないかは教えてくれません。しかも審査員が何を尋ねるかによって結果が大きく揺れるので、同じ相手を審査しても判定が割れます。試験として使うには目盛りがゆるすぎます。

それでもこの試験が残した問い

今では対話だけで相手を見分けることがずっと難しくなりました。だからこの試験は性能の基準からは退いた代わりに、別の場所でより重要になりました。人らしく聞こえる文を誰が書いたかわからなくなった世の中で、何を信じて何を確かめるべきかという問いです。

衝立の向こうの声がなめらかであるという事実は、その声が正しいという意味ではありません。チューリングテストが最初から分けておいたこの二つの違いが、それらしい文があふれる今、かえってはっきりと見えてきています。

3もう少し正確に

チューリングテストは1950年にアラン・チューリングが論文で提案した模倣ゲーム(Imitation Game)から生まれました。もとの形は審査員一人と参加者二人が文字だけで対話し、審査員がどちらが機械かを言い当てる遊びでした。合格の割合がどれくらいであるべきか、審査時間がどれくらいであるべきかといった細かな条件は論文で定められておらず、その後さまざまな人がそれぞれ違う条件で試みてきました。条件がゆるい短い対話では何度も人に選ばれた事例があり、条件を厳しくすると結果が変わります。

たとえがずれる点もあります。オーディションは審査基準があらかじめ決まっていて参加者が同じ課題を受けますが、この試験は審査員が何を尋ねるかによって難しさが丸ごと変わります。ざっくり尋ねる審査員の前では合格しやすく、罠を巧みに仕掛ける審査員の前ではずっと難しくなります。またオーディションは実力を見極めようとしますが、この試験が見極めるのは実力ではなく、人と区別が付かない度合いです。試験に合格した相手が本当に理解していたのかをめぐる議論は、今も続いています。

4やってみる

5よくある誤解

  • チューリングテストに合格すれば機械が人のように考えていると思われがちですが、実際には見分けが付かなかったという意味にすぎず、理解していたかはこの試験ではわかりません。

  • まだ誰も合格していないと見なされがちですが、実際には短くゆるい条件では人に選ばれた事例がいくつもあり、条件の定め方次第で結果は変わります。

  • チューリングテストがAI性能を測る標準の試験だと見られがちですが、実際には能力を項目ごとに分けて測る別の評価方法がその役割を担っています。

7ひとこと要約

つまりチューリングテストは衝立越しの対話だけを見て人か機械かを言い当てる試験で、合格したという言葉は人らしく聞こえたという意味であり、理解していたという意味ではありません。

誤りや、もっと良いたとえがありますか? 修正を提案する · 最終更新2026-09-02