Episode Details
Back to Episodes
Ep.1232 Googleが次世代AI「Gemini Omni」を発表──動画生成の常識を覆す“物理法則の理解” (2026年5月21日配信)
Description
タイトル
Googleが次世代AI「Gemini Omni」を発表──動画生成の常識を覆す“物理法則の理解”
このエピソードで登場するキーワードを説明します。
Gemini Omni (ジェミニ・オムニ): Googleが新たに発表した次世代マルチモーダル生成AIモデルファミリー。テキスト、画像、音声、動画を組み合わせて入力し、高度な推論能力と物理法則の理解に基づいた動画生成や対話形式での編集を可能にします。
マルチモーダル: テキストだけでなく、画像、音声、動画など、複数の異なる種類の情報を同時に処理できるAIの能力のこと。AIがより人間のように世界を理解するための鍵となる技術です。
SynthID (シンス・アイディー): Google DeepMindが開発した不可視の電子透かし技術。目には見えないマーカーをコンテンツに埋め込むことで、AIによって生成された画像や動画であることを識別し、フェイクニュースなどの悪用を防ぎます。
それでは解説に入ります。
2026年5月19日から開催されたGoogleの年次開発者会議「Google I/O 2026」にて、世界のAI開発競争をさらに加速させる驚きの発表がありました。それが、新しい生成AIモデルファミリー「Gemini Omni」の登場です。最初のモデルとなる「Gemini Omni Flash」は、これまで私たちが目にしてきた動画生成AIとは一線を画す性能を秘めています。
このGemini Omniの最大の特徴は、単に美しい映像を作るだけでなく、「物理法則を深く理解している」という点にあります。これまでの動画生成AIは、例えば「ボールを投げたときの自然な軌道」や「水がこぼれ落ちる時の流体の広がり」といった、私たちが普段当たり前だと感じている物理的な挙動を矛盾なく再現するのが非常に苦手でした。しかし、Gemini Omniは重力や運動エネルギーといった現実世界の仕組みを学習しており、より本物に近い、説得力のある映像を生み出すことができます。
さらに、動画の編集を人間と会話するような自然なやり取りで行えるのも大きな魅力です。「背景を別のものに変えて」「ここに新しいキャラクターを追加して」といった指示を次々と重ねていっても、映像全体の一貫性が崩れることなく仕上がっていきます。また、自分の顔や声を登録して「AIアバター」を作り、自分そっくりのデジタル分身を動画に出演させる機能も用意されており、ビジネスやクリエイティブの現場での表現の幅は無限に広がりそうです。
現在、世界のAI市場ではOpenAIによる動画生成モデルなどが大きな話題を集めており、巨大テック企業同士の熾烈な競争が続いています。その中でGoogleは、自社の強力なAIモデルであるGeminiの推論能力と、最新の映像レンダリング技術を組み合わせることで、単なる映像ツールにとどまらない、現実世界をシミュレーションできる「ワールドモデル」としての確固たる地位を築こうとしています。
もちろん、こうした強力な技術には安全性の確保が欠かせません。Gemini Omniで生成・編集された動画には、Googleの電子透かし技術である「SynthID」が標準で組み込まれ、AIが作ったものであることを後から検証できるようになっています。ディープフェイクへの懸念が高まる中、技術の進化と社会的責任のバランスをどう取るのか、業界をリードするGoogleの誠実な姿勢が示された発表だと言えるでしょう。
今回のエピソードは以上で終了です。また次回お会いしましょう。