ディープフェイクDeepfake

AIで顔や声を本物そっくりに合成した偽の映像・音声

ポイント
  • ディープフェイクは、顔の入れ替え、口の形をせりふに合わせるリップシンク、短い録音から声を似せる音声クローンの三つに分かれます。
  • 作り方は、顔を圧縮して元に戻す練習から始まり、競い合って学ぶ方式を経て、今は雑音から絵を戻す方式が画質を引き上げました。
  • まばたきや指のような目で見る手がかりは、もう通じません。見分けの実験で人の正解率は、コイン投げと大きく変わりません。
  • そこで対策は、偽物を見つける側から本物だと証明する側へ移りつつあります。来歴表示、ウォーターマーク、検知モデルを重ねて使います。
  • 技術そのものに罪はありませんが、同意なく作って広める行為は多くの国で処罰の対象です。個人にできるのは、元から知っている番号にかけ直して確かめることです。
目次

1たとえで理解する

ものまね名人が舞台に立つと、目を閉じて聞いている人はどちらが本人か迷います。名人はその人の声を何百回も聞きながら、息を継ぐ場所や語尾が上がる癖まで、まるごと移し取っているからです。ディープフェイクは、この芸を機械が代わりにやるものです。写真と映像と録音を何千回も見て、声だけでなく顔も表情も口の形も一緒に似せます。

舞台の上のものまねは笑いを生みますが、同じ芸で家族の声をまねて「お金を送ってほしい」と電話をかければ詐欺になります。芸そのものではなく、どこに使うかが分かれ道です。

2くわしく

まねは三つに分かれます

ディープフェイクというと顔の入れ替えから思い浮かべますが、種類は三つです。一つ目が顔の入れ替えです。映像の中の人物の顔だけを、別の人の顔に差し替えます。二つ目が口の形合わせです。顔はそのままにして、唇とあごだけを新しいせりふに合わせて描き直します。外国語の吹き替えに使う技術がここに入ります。三つ目が音声クローンです。数秒の録音さえあれば、話し方や息づかいまで移した声を作れます。

このごろ被害が大きいのは、三つを混ぜた形です。ビデオ会議の画面に顔をかぶせ、その上に声を載せると、受け取る側にとっては知っている人と通話しているのと区別がつきません

まねを身につける流れ

ものまね名人が練習するように、AIも材料を集めるところから始めます。顔ならいろいろな角度の写真と映像、声なら短い録音があれば足ります。

次は特徴を取り出す段階です。初期の方式は、顔を細かく圧縮してから元どおりに戻す練習をさせて、目と鼻と口の位置や表情だけが残った要約を得ていました。ここに、偽物を作る側と見破る側が競い合って腕を上げるGAN(Generative Adversarial Network、敵対的生成ネットワーク)方式が加わって、結果はずっともっともらしくなりました。

今の画質を引き上げたのは、雑音だらけの画面から絵を少しずつ戻していく拡散方式です。ぼんやりしたところから始めて何度も整えるので、髪の先や影のように以前は崩れていた部分が自然になりました。

なぜ目では見抜けないのでしょうか

以前はコツがありました。まばたきが少ない、指の数がおかしい、首と顔で肌の色が違う、といった手がかりです。この手がかりは長もちしませんでした。見分けのコツが知られると、その弱点を埋める方向に次のモデルが学習されるからです。

そのうえ、私たちが実際に出会うのは画質の良い元データではありません。グループチャットを何度か経てつぶれた映像、通話品質に押しつぶされた声です。不自然な部分が圧縮に埋もれてしまい、いっそう難しくなります。驚きや怒りを誘う内容ほど、確かめる前に広がってしまうことも重なります。

偽物を探すより本物を証明します

そこで対策は向きを変えました。偽物に印を押す代わりに、本物に印を押す側です。

一つ目はコンテンツの来歴表示です。撮影した機器と編集の履歴をファイルに署名して付けておき、あとでその署名が壊れていないかを確かめます。二つ目はウォーターマークです。AIで作った画像や音声に、人の目や耳では気づけない印を埋め込んでおきます。三つ目は検知モデルです。人には見えない細かな痕跡を機械が探します。

三つとも完全ではありません。署名は画面を撮り直すと外れ、ウォーターマークは切り取りや再圧縮に弱く、検知モデルは新しい生成方式の前で正確さが落ちます。ですから一つだけを信じず、重ねて使うのが基本です。

舞台と犯罪を分ける線

技術そのものに罪はありません。世を去った俳優を映画によみがえらせる、病気で声を失った人に以前の声を返す、講義をいくつもの言語に吹き替える、といった使い方があります。こうした使い方には共通点があります。本人の同意があり、作られた映像だという表示が付いています。

線を越えるのは、同意が抜けたときです。性的な合成物を作ったり広めたりする行為、家族や上司の声をまねた送金の要求、選挙時期の偽の発言映像がそれにあたり、多くの国で処罰の対象です。個人にできることは単純です。お金や個人情報を急かす連絡は、その通話やメッセージの中で確かめずに、いったん切って、元から知っている番号にかけ直してください。家族で短い合い言葉を決めておくともっと速く、公開アカウントに載せる顔写真や声を減らすことも、材料を減らす方法になります。

3もう少し正確に

ものまねのたとえは、似せるという結果だけが合っていて、過程は違います。名人は音を聞いて自分ののどを動かしますが、ディープフェイクは画面の点と音の波形が作る数字の分布を学習して、新しい画面と新しい波形を計算します。元のものを切り貼りするのではなく、学んだ分布にしたがって初めから描き直すほうに近いのです。

用語として整理すると、ディープフェイクはディープラーニング(Deep Learning、深層学習)とフェイク(fake)を合わせた言葉です。顔の入れ替えは人物ごとの特徴を圧縮して復元するオートエンコーダーから出発し、本物らしさはGANの敵対的な学習が引き上げ、最近は拡散モデルが主流になりました。音声クローンは短いサンプルから声色だけを取り出して新しい文に載せる方式なので、元の文章は要りません。検知モデルが出す値も真偽ではなく確率なので、結果は何パーセントという数字で出てきます。最終確認: 2026-09

最終確認: 2026-09

4やってみる

5よくある誤解

  • ディープフェイクはよく見れば分かると思われがちですが、実際は見分けの実験で人の正解率はコイン投げと大きく変わりません。

  • 有名人だけが標的になると思われがちですが、実際は公開アカウントに載せた写真数枚と短い通話の録音だけで、一般の人のディープフェイクも作られます。

  • 検知プログラムにかければ確実に見分けられると思われがちですが、実際は検知の結果は確率にすぎず、初めて見る生成方式の前では正確さが落ちます。

7ひとこと要約

つまりディープフェイクは顔と声をまるごとまねるAIのものまねなので、目で見分けようとするより、元から知っている番号にかけ直して確かめるのがいちばん確かな守りです。

誤りや、もっと良いたとえがありますか? 修正を提案する · 最終更新2026-09-02