評価・データ42語

AIの出来をどう測り、どんなデータで教えるかに関する用語です。正解率、適合率と再現率、ベンチマーク、ラベリング、バイアス、データ拡張など、性能表を読むときに必要な言葉を集めました。

難易度
A/BテストA/B Test

二つに分けて使わせ結果を比べる試験

入門
AIバイアスAI Bias

学習データの偏りがAIの判断にそのまま残った状態

倫理 入門
AI生成物検出AI Content Detection

AIが作ったものかどうかを見分けること

倫理 入門
EloレーティングElo Rating

対戦結果を積み重ねてつける実力の数値

基本
F1スコアF1 Score

適合率と再現率を一つにまとめた点数

基本
LLM審査LLM-as-a-Judge

言語モデルに答えの良し悪しを採点させること

基本
ROC・AUCROC & AUC

閾値を動かして測った成績を一本の曲線と数字に

応用
クラス不均衡Class Imbalance

片方の種類ばかり大量にある資料の偏り

基本
データクリーニングData Cleaning

集めた資料を使える状態に整える手入れ

入門
データサイエンスData Science

データから使える答えを引き出す仕事全体

基礎 入門
データセットDataset

AIを教えるために集めて整えた資料の束

基礎 入門
データバイアスDataset Bias

集めたデータ自体が一方に偏っている状態

入門
データリーケージData Leakage

採点用の情報が学習側へ入り込む事故

基本
データ拡張Data Augmentation

持っているデータを変形して種類を増やす方法

学習 基本
データ品質Data Quality

学習に使う資料がどれくらい信頼できるか

入門
パープレキシティPerplexity

次の言葉を何通りで迷っているかを表す値

言語モデル 応用
バウンディングボックスBounding Box

物体を囲む四角とその位置

認識 入門
プロンプト忠実度Prompt Adherence

頼んだとおりに出たかを測る物差し

生成 基本
ベンチマークBenchmark

複数の対象を同じ条件で測る共通問題集

入門
ラベリングLabeling

データ一つ一つに人が答えを付ける作業

入門
ラベルLabel

人が資料にあらかじめ付けておいた正解

基礎 入門
リーダーボードLeaderboard

評価点数を順に並べて見せる表

入門
過学習Overfitting

練習問題の答えだけ覚えて新しい問題が解けない状態

学習 基本
外れ値Outlier

残りの値からぽつんと離れて浮く値

入門
較正Calibration

言った確率と実際に当たった割合を合わせること

応用
学習曲線Learning Curve

回数が増えるほど点数がどう変わるか描いた線

学習 入門
学習不足Underfitting

単純すぎて練習問題すら解けない状態

学習 基本
堅牢性Robustness

条件が揺らいでも通用し続ける性質

基本
検証データValidation Set

学習に使わず点検にだけ使う取り分けたデータ

学習 入門
交差検証Cross-Validation

データを分割し順に検証して点数を平均する方法

学習 応用
合成データSynthetic Data

本物の代わりに作り出した練習用の資料

基本
混同行列Confusion Matrix

正解と不正解の四つの場合を枠に分けた表

基本
信頼度スコアConfidence Score

モデルが自分の答えに自分で付けた確信の数字

認識 入門
人手評価Human Evaluation

人が直接見て付ける評価

入門
正解データGround Truth

学習と採点の基準になる本当の答え

入門
正解率Accuracy

全体の判定のうち正解した割合

入門
説明可能性Explainability

AIがなぜそう判断したか示せる度合い

倫理 基本
適合率と再現率Precision & Recall

選んだ中の本物の割合と本物の中で見つけた割合

基本
特徴量Feature

AIが判断するときに見る材料ひとつ

基礎 入門
標本の偏りSampling Bias

誰を選んだかで生まれる資料の偏り

基本
評価指標Evaluation Metric

何をもって良しとするか決めておく物差し

入門
平均二乗誤差Mean Squared Error

外れた距離を二乗して平均した罰点

基本