평가·데이터42개

AI가 잘하는지 어떻게 재고, 어떤 데이터로 가르치는지에 관한 용어예요. 정확도, 정밀도와 재현율, 벤치마크, 라벨링, 편향, 데이터 증강처럼 성능 표를 읽을 때 필요한 말들을 모았어요.

난이도
강건성Robustness

조건이 흔들려도 여전히 통하는 성질

기본
검증 데이터Validation Set

학습에 쓰지 않고 점검에만 쓰려고 떼어 둔 자료

학습 입문
과소적합Underfitting

너무 단순해서 연습 자료조차 못 맞히는 상태

학습 기본
과적합Overfitting

연습 문제 답만 외워 새 문제는 못 푸는 상태

학습 기본
교차 검증Cross-Validation

자료를 조각내 돌아가며 점검하고 점수를 평균 내는 방법

학습 심화
데이터 과학Data Science

데이터에서 쓸 만한 답을 끌어내는 일 전체

기초 입문
데이터 누수Data Leakage

채점용 정보가 학습 쪽으로 새어 드는 사고

기본
데이터 정제Data Cleaning

모은 자료를 쓸 수 있는 상태로 다듬는 손질

입문
데이터 증강Data Augmentation

가진 자료를 변형해 가짓수를 늘리는 방법

학습 기본
데이터 편향Dataset Bias

모은 자료 자체가 한쪽으로 쏠려 있는 상태

입문
데이터 품질Data Quality

학습에 쓰는 자료가 얼마나 믿을 만한지

입문
데이터셋Dataset

AI를 가르치려고 모아 정리해 둔 자료 묶음

기초 입문
라벨Label

사람이 자료에 미리 붙여 둔 정답

기초 입문
라벨링Labeling

자료 하나하나에 사람이 답을 붙이는 작업

입문
리더보드Leaderboard

평가 점수를 줄 세워 순서로 보여 주는 표

입문
바운딩 박스Bounding Box

물체를 감싸는 네모와 그 네모의 자리

인식 입문
벤치마크Benchmark

여러 대상을 같은 조건으로 재는 공통 문제 묶음

입문
보정Calibration

말한 확률과 실제로 맞은 비율을 맞추기

심화
사람 평가Human Evaluation

사람이 직접 보고 매기는 평가

입문
설명 가능성Explainability

AI가 왜 그렇게 판단했는지 보여 줄 수 있는 정도

윤리 기본
신뢰도 점수Confidence Score

모델이 자기 답에 스스로 매긴 확신 숫자

인식 입문
엘로 점수Elo Rating

서로 겨룬 결과를 쌓아 매기는 실력 숫자

기본
이상치Outlier

나머지 값들과 뚝 떨어져 혼자 튀는 값

입문
정답 데이터Ground Truth

학습과 채점의 기준이 되는 진짜 답

입문
정밀도와 재현율Precision & Recall

골라낸 것 중 진짜 비율과 진짜 중 찾아낸 비율

기본
정확도Accuracy

전체 판정 가운데 맞힌 것의 비율

입문
클래스 불균형Class Imbalance

한쪽 종류만 잔뜩 몰려 있는 자료의 치우침

기본
특징Feature

AI가 판단할 때 들여다보는 재료 한 가지

기초 입문
퍼플렉시티Perplexity

다음 말을 몇 갈래에서 헷갈리는지 나타낸 값

언어 모델 심화
평가 지표Evaluation Metric

무엇으로 잘한다고 할지 정해 둔 잣대

입문
평균 제곱 오차Mean Squared Error

빗나간 거리를 제곱해 평균 낸 벌점

기본
표본 편향Sampling Bias

누구를 뽑았느냐 때문에 생기는 자료의 쏠림

기본
프롬프트 충실도Prompt Adherence

주문한 대로 나왔는지 재는 잣대

생성형 기본
학습 곡선Learning Curve

회차가 늘수록 점수가 어떻게 변하는지 그린 선

학습 입문
합성 데이터Synthetic Data

진짜 대신 만들어 낸 연습용 자료

기본
혼동 행렬Confusion Matrix

맞고 틀린 네 경우를 칸에 나눠 적은 표

기본
A/B 테스트A/B Test

둘로 나눠 써 보게 하고 결과를 견주는 시험

입문
AI 생성물 탐지AI Content Detection

AI가 만든 것인지 가려내는 일

윤리 입문
AI 편향AI Bias

학습 자료의 치우침이 AI 판단에 그대로 남은 상태

윤리 입문
F1 점수F1 Score

정밀도와 재현율을 하나로 합친 점수

기본
LLM 심사LLM-as-a-Judge

언어 모델에게 답의 좋고 나쁨을 매기게 하기

기본
ROC·AUCROC & AUC

문턱을 옮겨 가며 잰 성적을 한 곡선과 한 숫자로

심화