マルチモーダルAIとは何か――文章・画像・音声をまとめて扱うAIをやさしく理解する
- 1 マルチモーダルAIとは何か
- 2 従来のAIは一つの種類の情報を扱うことが多かった
- 3 人間もマルチモーダルで情報を理解している
- 4 画像を見て答えるAI
- 5 音声を聞いて理解するAI
- 6 動画を理解するAI
- 7 マルチモーダルAIはどうやって違う情報をつなげるのか
- 8 文章と画像の関係を学ぶ
- 9 マルチモーダルAIでできること
- 10 生成AIとマルチモーダルAIは同じなのか
- 11 大規模言語モデルとの関係
- 12 マルチモーダルAIと埋め込みの関係
- 13 マルチモーダルAIの仕事での活用
- 14 マルチモーダルAIの強み
- 15 マルチモーダルAIにも間違いはある
- 16 画像や音声をAIに渡すときの注意点
- 17 マルチモーダルAIはAIとの接し方を変える
- 18 まとめ
前回は、「埋め込みとは何か」について説明しました。
埋め込みとは、文章や画像などの意味や特徴を、コンピューターが比較しやすい数字の並びに変える仕組みです。
ここまでのシリーズでは、主に文章を扱うAIについて説明してきました。しかし、現在のAIは文章だけを扱うものではありません。画像を見たり、音声を聞いたり、動画を理解したり、それらを文章と組み合わせて扱ったりできるAIが増えています。そこで登場するのが、マルチモーダルAIです。
一言でいうと、マルチモーダルAIとは、文章・画像・音声・動画など、複数の種類の情報をまとめて扱えるAIです。

マルチモーダルAIとは何か
「マルチモーダル」という言葉は、少し難しく聞こえます。マルチは「複数の」という意味です。モーダル、またはモダリティとは、情報の種類や形式を指します。
たとえば、人間が情報を受け取る方法には、いろいろあります。
- 文章を読む
- 画像を見る
- 音声を聞く
- 動画を見る
- 話す
こうした異なる情報の種類を、AIの世界では「モダリティ」と呼びます。つまり、マルチモーダルAIとは、複数のモダリティを扱えるAIということです。
たとえば、画像を見せて「この写真には何が写っていますか」と質問し、その内容を文章で答えてもらう。あるいは、音声を聞かせて内容を文字起こしし、その内容を要約してもらう。このように、異なる種類の情報を組み合わせて処理できるのが、マルチモーダルAIです。
従来のAIは一つの種類の情報を扱うことが多かった
以前のAIは、特定の種類の情報だけを扱うものが多くありました。たとえば、画像認識AIは画像を扱います。音声認識AIは音声を扱います。文章生成AIは文章を扱います。それぞれ別々のAIとして作られていることが多かったのです。
| AIの種類 | 主に扱う情報 | 例 |
|---|---|---|
| 文章AI | テキスト | 質問応答、要約、翻訳 |
| 画像認識AI | 画像 | 物体認識、顔認識 |
| 音声認識AI | 音声 | 文字起こし |
| マルチモーダルAI | 文章・画像・音声・動画など | 画像を見て質問に答える、音声を聞いて要約する |
マルチモーダルAIでは、これらを別々に使うだけではありません。文章と画像、音声と文章、画像と音声などを組み合わせて理解します。これが大きな違いです。
人間もマルチモーダルで情報を理解している
マルチモーダルAIは、人間の情報の受け取り方に少し似ています。人間は、会話するときに相手の言葉だけを聞いているわけではありません。声の大きさ、表情、身振り、周囲の状況なども見ています。たとえば、「大丈夫です」と言われても、相手が笑顔なのか、泣きそうな顔なのかによって受け取り方は変わります。教科書を読むときも、文章だけではなく、図、写真、グラフ、表などを一緒に見ます。つまり、人間はもともと複数の種類の情報を組み合わせて理解しています。マルチモーダルAIも、文章だけに頼らず、複数の情報を組み合わせることで、より多くのことを扱えるようになります。
画像を見て答えるAI
マルチモーダルAIのわかりやすい例が、画像を見て質問に答える機能です。たとえば、冷蔵庫の中の写真をAIに見せて、次のように質問できます。「この中にある材料で作れそうな料理を教えてください。」AIは画像の中に、卵、牛乳、野菜などがあることを読み取り、それを文章の質問と組み合わせて回答します。
また、グラフの画像を見せて、「このグラフからわかることを説明してください」と頼むこともできます。
紙の書類の写真を見せて、内容を整理してもらうこともできます。
- 写真に何が写っているか説明する
- グラフを読んで傾向を説明する
- 書類の写真から内容を読み取る
- 図を見ながら質問に答える
- 画面のスクリーンショットから操作方法を説明する
このように、画像と文章を一緒に扱えることで、AIに相談できる範囲が大きく広がります。
音声を聞いて理解するAI
マルチモーダルAIは、音声も扱えます。もっとも身近なのは、音声を文字に変える機能です。会議の録音を文字起こししたり、話した内容をそのまま文章にしたりできます。さらに、音声の内容を理解したうえで、要約したり、質問に答えたりすることもできます。たとえば、1時間の会議音声をAIに渡し、次のように頼むことができます。
「この会議で決まったことと、次回までにやることを整理してください。」
AIは音声を文章として認識し、その内容を分析して答えを作ります。
また、音声AIが発達すると、話し方や声の調子なども情報として扱える可能性があります。ただし、声から感情や状態を推測する場合には、誤判定やプライバシーなどにも注意が必要です。
動画を理解するAI
動画は、画像と音声に加えて「時間の流れ」があります。そのため、文章や静止画像よりも扱う情報量が多くなります。マルチモーダルAIでは、動画の中で何が起きているのかを読み取り、説明することもできます。
たとえば、次のような使い方があります。
- 動画の内容を要約する
- 特定の場面を探す
- 会議動画から重要な発言を抜き出す
- 作業動画を見て手順を説明する
- 授業動画から学習内容を整理する
動画には大量の情報が含まれるため、AIが処理する計算量も大きくなります。それでも、動画を直接理解できるAIが発達すると、教育、仕事、映像制作など多くの分野で活用が広がります。
マルチモーダルAIはどうやって違う情報をつなげるのか
文章、画像、音声は、まったく違う種類のデータです。文章は文字の並びです。画像は画素の集まりです。音声は時間とともに変化する波のデータです。そのままでは、コンピューターが同じ方法で比較することはできません。そこで、それぞれの情報から特徴を取り出し、AIが扱える数値表現に変換します。
前回説明した「埋め込み」も、ここで重要になります。
文章の意味を表す埋め込み、画像の特徴を表す埋め込みなどを作ることで、異なる種類の情報同士を結びつけやすくなります。たとえば、猫の画像と「猫」という文章が、意味として近いものになるように学習させることができます。そうすることで、AIは画像を見て「これは猫だ」と判断したり、「猫の写真を探して」という文章から該当する画像を探したりできるようになります。
文章と画像の関係を学ぶ
マルチモーダルAIを理解するために、画像と文章の組み合わせを考えてみましょう。たとえば、犬が公園を走っている写真があります。その写真には、次のような説明文を付けられます。
「茶色い犬が公園の芝生を走っている。」
AIが大量の画像と説明文の組み合わせを学ぶと、画像の特徴と言葉の関係が見えてきます。「犬」という言葉はどのような画像と結びつくのか。「芝生」はどのような見た目なのか。「走っている」とはどのような姿勢なのか。こうした関係を学ぶことで、AIは画像と言葉をつなげられるようになります。
マルチモーダルAIでできること
マルチモーダルAIによって、AIの使い方は大きく広がります。
- 写真を見せて質問する
- グラフや図を説明させる
- 音声を文字起こしする
- 会議音声を要約する
- 動画の内容を整理する
- 文章から画像を生成する
- 画像について文章で説明する
- 音声で質問し、音声で回答してもらう
- 書類の写真から必要な情報を取り出す
これまで別々のソフトで行っていた作業を、一つのAIとのやり取りで行えるようになりつつあります。
生成AIとマルチモーダルAIは同じなのか
生成AIとマルチモーダルAIも、よく混同されます。
生成AIとは、新しい文章、画像、音声、動画などを作るAIです。
マルチモーダルAIとは、複数の種類の情報を扱うAIです。そのため、同じ意味ではありません。
| 用語 | 意味 | ポイント |
|---|---|---|
| 生成AI | 新しい文章・画像・音声などを作るAI | 「何かを作る」ことが中心 |
| マルチモーダルAI | 文章・画像・音声など複数の情報を扱うAI | 「複数の情報形式を扱う」ことが中心 |
実際には、両方の特徴を持つAIが多くあります。たとえば、画像を入力して、その内容について文章で答えるAIはマルチモーダルAIです。さらに、そのAIが画像や音声も生成できるなら、生成AIでもあります。
大規模言語モデルとの関係
大規模言語モデルは、もともと主に文章を扱うAIとして発展しました。しかし現在では、大規模言語モデルを中心に、画像や音声などを扱う機能を組み合わせたAIが増えています。画像を処理する仕組みで画像の特徴を読み取り、その情報を言語モデルが扱える形に変換します。すると、大規模言語モデルは文章だけでなく、画像についても会話できるようになります。音声についても同じように、音をAIが扱える表現に変換し、言語モデルにつなげることができます。そのため、現在のAIは「言語モデル」という名前でも、実際には文章だけに限らないものが増えています。
マルチモーダルAIと埋め込みの関係
前回説明した埋め込みは、マルチモーダルAIでも重要です。文章、画像、音声など、異なる情報を数値として表現できれば、それらの関係を計算できます。たとえば、文章と画像を同じような「意味の空間」に置ければ、次のようなことができます。
- 文章から似た画像を探す
- 画像から似た文章を探す
- 画像と説明文が合っているか調べる
- 複数の情報をまとめて検索する
つまり、埋め込みは、異なるモダリティを橋渡しするためにも使われます。
マルチモーダルAIの仕事での活用
マルチモーダルAIは、仕事でもさまざまな使い方が考えられます。たとえば、商品の写真を見せて、商品説明文を作ることができます。会議の録音から文字起こしを行い、議事録を作ることもできます。画面のスクリーンショットを見せて、操作上の問題を相談することもできます。紙の書類を撮影して、必要な情報を整理することもできます。
| 入力 | AIに頼めること |
|---|---|
| 商品の写真 | 特徴を読み取り、説明文を作る |
| 会議音声 | 文字起こし、要約、決定事項の抽出 |
| グラフ画像 | 傾向を説明する |
| パソコン画面の画像 | エラーや操作方法を説明する |
| 書類の写真 | 内容を読み取り、情報を整理する |
文章だけを扱うAIと比べて、現実の仕事にあるさまざまな情報をそのまま渡しやすいことが大きな利点です。
マルチモーダルAIの強み
マルチモーダルAIの大きな強みは、一つの種類の情報だけではわからないことを、複数の情報から判断できることです。
- 文章だけでは説明しにくいものを画像で伝えられる
- 画像だけではわからない目的を文章で伝えられる
- 音声や動画も直接扱える
- 人間に近い形で情報を渡しやすい
- 複数の作業を一つのAIで行いやすくなる
たとえば、パソコンでエラーが出たとき、エラー内容をすべて文章で説明するのは大変です。画面のスクリーンショットをそのまま見せて、「どこが問題ですか」と聞ければ、相談がかなり簡単になります。これは、マルチモーダルAIのわかりやすい利点です。
マルチモーダルAIにも間違いはある
マルチモーダルAIはとても便利ですが、画像や音声を見せれば必ず正しく理解するわけではありません。画像の一部を見落とすこともあります。小さい文字を読み間違えることもあります。似た物体を間違えて認識することもあります。音声では、雑音や話し方によって聞き間違えることがあります。動画では、出来事の順番を誤解する可能性もあります。
- 画像の細かい部分を見落とすことがある
- 文字や数字を読み間違えることがある
- 似たものを誤認識することがある
- 音声を聞き間違えることがある
- 動画の内容を誤解することがある
- ハルシネーションが起こることもある
AIが「画像を見た」「音声を聞いた」からといって、その内容を完全に理解しているとは限りません。重要な情報は、人間が確認する必要があります。
画像や音声をAIに渡すときの注意点
マルチモーダルAIでは、文章以外の情報をAIに渡せるため、プライバシーにも注意が必要です。写真には、人の顔、住所、車のナンバー、書類の個人情報などが写っていることがあります。会議の音声には、社外秘の情報や個人名が入っていることもあります。画面のスクリーンショットには、メールアドレス、パスワード、顧客情報などが表示されているかもしれません。そのため、AIに画像や音声を渡す前に、不要な個人情報や機密情報が含まれていないか確認することが大切です。
マルチモーダルAIはAIとの接し方を変える
これまでコンピューターを使うには、キーボードで文字を入力したり、決められた画面を操作したりする必要がありました。しかし、マルチモーダルAIが発達すると、人間はもっと自然な方法でコンピューターに情報を渡せるようになります。わからないものがあれば写真を見せる。説明するのが面倒なら話す。資料があればそのまま渡す。画面に問題があればスクリーンショットを見せる。つまり、人間がコンピューターに合わせるのではなく、コンピューターの方が人間の情報の伝え方に近づいていくことになります。
これは、マルチモーダルAIの大きな意味の一つです。
まとめ
マルチモーダルAIとは、文章、画像、音声、動画など、複数の種類の情報をまとめて扱えるAIです。「マルチ」は複数、「モダリティ」は情報の種類という意味です。
従来は、文章AI、画像認識AI、音声認識AIなどがそれぞれ別々に使われることが多くありました。>マルチモーダルAIでは、それらを組み合わせて扱います。>そのため、画像を見せて質問したり、音声を聞かせて要約したり、動画の内容を説明させたりすることができます。文章と画像など、異なる情報を結びつけるためには、埋め込みのような数値表現も重要になります。
マルチモーダルAIによって、AIはより人間に近い形で情報を受け取れるようになります。一方で、画像の読み間違い、音声の聞き間違い、ハルシネーション、個人情報や機密情報の問題などにも注意が必要です。マルチモーダルAIは、AIを「文章を入力して使う道具」から、「見せる・話す・聞かせることでも使える道具」へと広げる技術です。
次回は、「エージェントAIとは何か」について説明します。
マルチモーダルAIがさまざまな情報を扱うAIだとすると、エージェントAIは、AIが目的に向かって複数の作業を進める仕組みです。AIが「答える」だけでなく「行動する」とはどういうことなのかを、やさしく見ていきます。