Episode Details
Back to Episodes
Ep.889 Google「Agentic Vision」発表──AIの目は“見る”から“調査する”へ(2026年2月5日配信)
Description
2026年1月27日、GoogleはAIの「視覚」における常識を覆す新機能、「Agentic Vision」を発表しました。これまでAIが画像を認識する際は、人間がパッと全体を見るように、静止画を一度だけ入力して処理するのが一般的でした。しかし、これには限界があります。例えば、引きの画像に写っている小さな文字や、複雑な図面の細部など、解像度の壁で「見落とし」や「当てずっぽうな回答」が発生しがちだったのです。
今回、Gemini 3 Flashに搭載されたAgentic Visionは、この受動的なプロセスを「能動的な調査」へと変えました。具体的には、AIが画像を一度見て「ここの文字が読みにくいな」と判断すると、自らPythonコードを書いてその部分だけを拡大(クロップ)し、高解像度で再読込して確認するという動きを見せます。これはまさに、私たちが細かい文字を読むときに虫眼鏡を取り出したり、顔を近づけてのぞき込んだりする動作と同じです。
Googleの公式ブログによると、この「思考・行動・観察」のループによって、AIは自信を持って細部を認識できるようになります。例えば、建物の設計図をチェックする「PlanCheckSolver.com」というサービスでは、この技術を導入することで、複雑な図面のコンプライアンス確認精度が向上したと報告されています。屋根の端の形状や微細な寸法数値など、従来なら見逃していたディテールをAIが自律的にズームインして検証できるようになったからです。
この技術の面白い点は、AIが「自分の目の限界」を理解し、道具(コード実行)を使ってそれを克服しようとする点にあります。単に画素数が増えるだけでなく、AIが「何を見るべきか」を戦略的に判断するようになったことは、産業用検査や医療画像診断など、ミスが許されない現場での活用を一気に加速させる可能性があります。