画像・映像・音声47語
AIが写真の中の物体を見分け、人の姿勢を捉え、話し声を文字に変える仕組みです。CNN、物体検出、セグメンテーション、姿勢推定、TTS、STTなど、ウェブカメラとマイクで実際に体験できる概念が多くあります。
写真の模様を層ごとに見つけ出すニューラルネットワーク構造
NeRFNeural Radiance Field位置と方向を尋ねると光を答える3D場面
OCR絵の中の文字を読み取って文字データに変える仕事
STTSpeech-to-Text音を入れると文字が出てくる変換
TTSText-to-Speech文字を入れると声で読み上げる技術
アップスケールUpscalingなかった細部を作って埋めながら絵を大きくすること
ガウシアンスプラッティングGaussian Splatting色の染み数百万個で持つ3D場面
キーポイントKeypoint画像の中で位置をひとつの点で示した場所
コンピュータビジョンComputer Vision写真や映像をコンピュータが理解できるようにする技術
ジェスチャー認識Gesture Recognition手や体の動きをあらかじめ決めた意味に読み替えること
スペクトログラムSpectrogram音を目で見えるように描いた図
セグメンテーションSegmentation写真の点一つ一つに名札を付ける仕事
ノイズ除去Denoising元の内容は残し混ざった汚れだけを取り除く作業
バウンディングボックスBounding Box物体を囲む四角とその位置
パターン認識Pattern Recognitionくり返し現れる規則性を見分ける仕事
ハンドトラッキングHand Tracking手の関節の位置を毎瞬間つなげて追いかけること
ビジョントランスフォーマーVision Transformer写真を断片に切って文のように扱う構造
フィルターFilter / Kernel何を探すかが書き込まれた小さな数値の板
プーリングPooling区域ごとに代表値だけ残して絵を縮める段階
ボコーダーVocoder音の設計図を実際の波形に変える部分
モーションキャプチャーMotion Capture体の動きを点の位置の記録として残すこと
ランドマークLandmark決まった場所ごとに番号が付いた基準点
リアルタイム推論Real-Time Inference毎瞬間決まった時間内に判断を終わらせること
リップシンクLip Sync音のリズムに口の形を合わせること
音楽生成Music Generation注文数行で曲を作り出すこと
音源分離Source Separation混ざった音を種類ごとに分けること
音声アシスタントVoice Assistant話しかけて頼み、話し声で答えを聞くAI
音声クローンVoice Cloning短い録音で他人の声を真似ること
音声認識Speech Recognition人の話し声を文字に書き起こす技術
音程検出Pitch Detection音の高さを突き止めること
音分類Sound Classification短い音のひと区切りに名札を一つ付けること
画像キャプショニングImage Captioning写真を見てその内容を文章で書いてくれること
画像分類Image Classification写真一枚に名札を一つ付ける仕事
解像度Resolution絵を作る点の数
顔検出Face Detection写真のどこに顔があるかを四角で見つけ出すこと
顔認識Face Recognition顔を照らし合わせて誰なのかを突き止めること
彩色Colorization白黒の絵に似合う色を入れること
姿勢推定Pose Estimation体の関節の位置を点で打って姿勢を読み取ること
畳み込みConvolution小さな板を動かしながら写真を調べる計算
信頼度スコアConfidence Scoreモデルが自分の答えに自分で付けた確信の数字
深度推定Depth Estimation写真一枚から近さと遠さを読み取ること
動作認識Action Recognitionつながった場面を見て何の動作か言い当てること
特徴マップFeature Map走査の結果を場所そのままに並べた絵
背景除去Background Removal写真から背景を消して対象だけ残す仕事
物体検出Object Detection写真の中の物を見つけて四角で囲む仕事
物体追跡Object Tracking同じ対象に同じ番号を付け続けること
話者認識Speaker Recognition声で誰が話したかを見分けること