買い物カゴに追加されました
買い物カゴに追加されました
理工書カタログバナーリンク 図書館カタログバナーリンク
マルチモーダルモデル入門

マルチモーダルモデル入門

3,960(税込)

数量

X在庫なし(発売前)

著者

栗田修平品川政太朗柳凜太郎塩野大輝高道慎之介仁泉大輔中村友彦八木拓真篠原崇之 著

定価

3,960円(本体3,600円+税10%)

発売日

2026.9.28

判型

B5変形

頁数

352ページ

ISBN

978-4-297-15836-1

 

 

本書は、画像や音声、動画など複数の異なるデータを扱う「マルチモーダルモデル」の入門書です。

自動運転やロボット、AIエージェントといった存在が、実世界の複雑な情報を理解して人間と円滑にコミュニケーションをとるために必要とする最先端技術を、基礎知識からその仕組みまで体系的に解説します。共通基盤となるTransformerの基礎からはじめ、視覚・音声・動画・3次元データの各モデルにふれたうえで、画像・音声・自然言語の融合モデルを解説します。

マルチモーダルモデルを用いた研究や開発に応用できる確かな力が身につく一冊です。

こんな方にオススメ

  • マルチモーダルモデルに興味がある方

 

 

 

プロフィール

栗田修平(くりたしゅうへい)

国立情報学研究所 コンテンツ科学研究系 助教。東京科学大学 情報理工学院 特任准教授。博士(情報学)(京都大学)。実世界・物理世界を理解するための自然言語処理研究に従事。1章の一部の執筆を担当。

品川政太朗(しながわせいたろう)

SB Intuitions株式会社、奈良先端科学技術大学院大学 客員助教。2020年に奈良先端科学技術大学院大学 博士後期課程を修了。博士(工学)。マルチモーダル基盤モデルの研究開発に従事。6章および1章の一部の執筆を担当。

柳凜太郎(やなぎりんたろう)

産業技術総合研究所 人工知能研究センター 研究員。2024年に東京大学 博士後期課程を修了(博士(情報科学))。視覚言語処理の研究に従事。2章の2.1節と2.8節の執筆を担当。

塩野大輝(しおのだいき)

東北大学大学院情報科学研究科博士後期課程3年2024年3月に東北大学大学院情報科学研究科修士課程を修了。大学では、大規模視覚言語モデルの開発・応用・分析に関する研究に従事。2章の2.2節から2.7の執筆を担当。

高道慎之介(たかみちしんのすけ)

慶應義塾大学 准教授。2016年に奈良先端科学技術大学院大学 博士後期課程を修了。音声研究に従事。3章の一部の執筆を担当。

仁泉大輔(にいずみだいすけ)

SB Intuitions株式会社(執筆時:NTT株式会社)。東京都立大学 客員研究員。2026年に東京都立大学大学院にて博士(情報科学)を取得(論文博士)。音の表現学習の研究に従事。3章の一部の執筆を担当。

中村友彦(なかむらともひこ)

産業技術総合研究所 主任研究員。2016年に東京大学 博士後期課程を修了(博士(情報理工学))。音楽信号処理、音響信号処理の研究に従事。3章の一部の執筆を担当。

八木拓真(やぎたくま)

産業技術総合研究所 人工知能研究センター 主任研究員。2022年に東京大学 博士後期課程を修了(博士(情報理工学))。動画理解の研究に従事。4章の執筆を担当。

篠原崇之(しのはらたかゆき)

産業技術総合研究所 レジリエントインフラ実装研究センター 主任研究員。2022年に東京工業大学 博士後期課程を修了(博士(工学))。コンピュータビジョンを活用した土木インフラ管理の研究に従事。5章の執筆を担当。

 

この本に関連する書籍