概要
本書は,画像や音声,動画など複数の異なるデータを扱う「マルチモーダルモデル」の入門書です。
自動運転やロボット,AIエージェントといった存在が,実世界の複雑な情報を理解して人間と円滑にコミュニケーションをとるために必要とする最先端技術を,基礎知識からその仕組みまで体系的に解説します。共通基盤となるTransformerの基礎からはじめ,視覚・音声・動画・3次元データの各モデルにふれたうえで,画像・音声・自然言語の融合モデルを解説します。
マルチモーダルモデルを用いた研究や開発に応用できる確かな力が身につく一冊です。
こんな方におすすめ