LLM審査LLM-as-a-Judge

言語モデルに答えの良し悪しを採点させること

ポイント
  • LLM審査は人の代わりに言語モデルに答えを読ませ、点数や勝敗を付けさせる方法です。
  • 利点は速さと安さです。数万件を数時間で採点できるので、何度も回せます。
  • ただし癖があります。長い答え、先に見せた答え、自信のある口調、自分と似た文章を高く評価します。
  • だから審査結果をそのまま信じません。同じ案件を人が採点した結果と比べ、どれだけ重なるかをまず確認します。
  • 向いている場面は決まっています。開発中に何度も確認するときは良く、最終判定を残すときは人の評価が必要です。
目次

1たとえで理解する

裁縫で使う物差しには二種類あります。一つはまっすぐ伸びた金属の物差しです。目盛りが伸び縮みしないので、測った値をそのまま信じられます。ただし長さが決まっていて曲線には当てにくく、一つ測るたびに姿勢を直しながら何度も当て直す必要があります。

もう一つはポケットに丸めて入れて持ち歩く布の巻き尺です。どこにでも当てられて、あっという間に値が出ます。けれども長く使った布の巻き尺は少し伸びています。実際より短めに出るのが常です。LLM審査はこの布の巻き尺です。

伸びた布の巻き尺も捨てたものではありません。一日に何百回も測る仕事には、これ以外の方法がないからです。代わりに、たまに金属の物差しに当ててどれくらいずれているかを知っておく必要があります。ずれの大きさを知らずに使うのと、知って使うのとではまったく違います。

2くわしく

どうやって採点させるか

いちばん単純な方法は、答えを一つ見せて点数を付けさせることです。何を見るかを書いた基準表を一緒に渡し、項目ごとに何点かを答えさせます。作るのは簡単ですが目盛りが揺れます。同じ答えをもう一度入れても点数が少しずつ変わり、たいてい甘めに寄ります。

もっと安定した方法は、二つの答えを並べて見せてどちらが良いかを選ばせることです。絶対的な目盛りが要らないので、結果がずっと揃います。ここで先に理由を書かせてから判定を出させると、精度が目に見えて上がります。先に答えを出してから理由を付けさせると、理由が言い訳になってしまうからです。

正解のある問題なら、正解を一緒に渡す方法も良いです。審査するモデルが自分の知識に頼らず照合するだけになるので、詳しくない分野でも判定がずっと安定します。

伸びた目盛り、四つの癖

一つ目は長さです。長く書いた答えを高く評価する傾向がはっきりあります。内容が同じでも段落を伸ばすと点数が上がります。

二つ目は順序です。二つの答えのうち先に見せたほうを高く評価することがよくあります。そのため順序を入れ替えて二回尋ね、二回とも同じほうを選んだときだけ勝敗を認める方法が使われます。

三つ目は似た文体です。自分が書いたものと似た文体の答えを高く評価します。採点するモデルと採点されるモデルが同じ系統だと、この問題が大きくなります。

四つ目は口調です。自信に満ちた文には甘い点数が付きます。正確だが慎重に書いた答えが、間違っているが断定的な答えに負けることが起こります。

ずれの大きさを測っておく

この癖をなくすことはできません。ですが、どれくらいずれているかは知っておけます。方法は簡単です。同じ案件を数百件、人にあらかじめ採点してもらい、同じ案件をモデルに採点させて、二つの結果がどれだけ重なるかを数えます。

重なる割合が高ければ、その先は安心して自動で回せます。低ければモデルのせいだけにせず、まず基準表を疑います。人どうしでも判断が分かれる項目なら、モデルでも分かれて当然だからです。

一度合わせて終わりでもありません。採点するモデルが変わったり扱う話題が変わったりすると、ずれの大きさがまるごと変わります。布の巻き尺を新しく買ったら、また当て直す必要があるのと同じです。

どこで使い、どこで使わないか

向いている場面は開発中の繰り返し確認です。プロンプトを少し直すたびに数千件を採点し直し、どちらが良くなったか見る必要がありますが、こうした作業に人を呼ぶわけにはいきません。目立つ失敗をふるい落とす網としても向いています。

反対に注意すべき場面は外に出す成績です。審査するモデルと採点されるモデルが同じ系統のとき、そしてその点数が宣伝に使われるときは、判定を人に任せるのが正しいです。安全性や事実確認のように、間違えたときの損害が大きい判定も同じです。

3もう少し正確に

LLM審査が人の評価の代わりになるという表現は正確ではありません。この方法が真似ているのは「人ならどう判定しただろうか」であり、その基準自体は今でも人の評価から来ています。二つの結果がどれだけ重なるかを測っていない審査は、目盛りを確認していない巻き尺と同じで、数字は出てもその数字が何を意味するのか分かりません。

たとえがずれる点もあります。伸びた布の巻き尺はいつも同じ方向にずれるので値を補正できますが、モデルの癖は話題や文体によってばらつきます。ある分野では人とほぼ同じ判定を下しても、別の分野ではまったく違うほうを選ぶこともあります。だから全体の重なり具合一つだけを見ず、分野ごとに分けて確認する必要があります。

採点結果を再び学習に使う場合には、もう一つ付け加わります。モデルが好む答えをモデルが再び学ぶと、その癖は消えるどころか濃くなります。このときは人が採点した資料を一定の割合で混ぜておく安全策が必要です。

4やってみる

5よくある誤解

  • モデルが採点すれば人より一貫していると思われがちですが、実際には同じ答えをもう一度入れても点数が揺れ、答えを見せる順序でも揺れます。

  • もっと優れたモデルに採点を任せれば解決すると思われがちですが、実際には性能が上がっても長さや口調を好む癖はそのまま残ります。

  • 審査結果が高ければ人も気に入る答えだと思われがちですが、実際には二つの結果がどれだけ重なるかを測るまでは分かりません。

7ひとこと要約

つまりLLM審査は言語モデルに採点を任せて速く安く結果を得る方法で、長さと順序と口調に揺れる癖があるため、人の評価とどれだけ重なるかを測ってから使うべきです。

誤りや、もっと良いたとえがありますか? 修正を提案する · 最終更新2026-09-02