「AIの進化で事務職の仕事が減る」——そう言われて久しいですが、その波はついに、最も人間くさい現場である「建設現場の最前線」にまで届き始めています。
2026年7月、清水建設が国内最高層ビル「Torch Tower」で実施したAIロボットの実証実験が注目を集めています。中でも話題になっているのが、人型ロボットによる「自律現場巡回」です。今回はこの技術を切り口に、いま各業界で語られ始めている「フィジカルAI」というキーワードの正体と、私たちの仕事にどう関わってくるのかを整理してみます。
フィジカルAIとは何か
フィジカルAIとは、ひとことで言えば「体を持ったAI」のことです。これまでのAI(ChatGPTのような対話型AI)は、画面の中でテキストや画像を処理するだけの存在でした。一方フィジカルAIは、カメラやセンサーという「目」と、ロボットの脚や腕という「体」を持ち、現実の物理空間の中で判断し、行動します。
Torch Towerの自律巡回ロボットは、まさにこの好例です。資材が置かれ、仮設の段差があり、多くの作業員が行き交う「カオスな現場」を、人の早歩きに近い速度で自律的に歩き回ります。
なぜ今までできなかったのか:「認知」と「判断」の融合
これまでのロボットは、あらかじめ決められたルートしか歩けませんでした。想定外の障害物があれば、その場で立ち往生してしまいます。
新型のフィジカルAIが違うのは、次の3ステップをリアルタイムで回している点です。
- 認知(Sense):LiDAR(レーザーで周囲の立体形状を瞬時に測るセンサー)やカメラで、周囲の状況をコンマ数秒ごとにスキャンする
- 判断(Think):設計図面(BIM)と照らし合わせ、「本来あるべき状態」と「今の障害物」の違いを比較する
- 行動(Act):障害物を避ける最適な足の運びを、その場で計算して実行する
人間が無意識に「あ、ここに脚立があるから少し右へ」と判断しているプロセスを、AIが仮想空間上の現場モデル(デジタルツイン)の中で超高速にシミュレーションしているというわけです。
本当のイノベーションは「映像を理解する」こと
このロボットのすごさは、単に歩けることではありません。本質は、撮影した映像を「マルチモーダルLLM」で解析している点にあります。
マルチモーダルLLMとは、テキストだけでなく画像や映像も同時に読み込み、そこに写っているものの意味や文脈を人間のように理解できるAIです。これにより、ロボットが巡回中に撮った映像は、単なる「記録写真」ではなく、次のような高度な判断材料に変わります。
- 通路をふさぐ資材を見て「避難動線を塞ぐリスクがある」と文脈で理解し、自動でアラートを出す
- 設計データ(BIM)と現場の映像を重ね合わせ、「このエリアの施工は計画より3%遅れている」といった進捗の判定を人手を介さずに行う
現場監督の仕事はどう変わるのか
この技術が定着した現場では、監督の一日はどう変わるでしょうか。従来、現場監督の労働時間の6〜7割は、次のような「事務作業」に費やされていました。
- 広い現場を歩き回って進捗を確認する
- 何百枚もの写真を撮影する
- 事務所に戻り、写真を仕分けして書類に貼り付ける
これらは「技術的な判断」ではなく、純然たる作業です。フィジカルAIがこの部分を肩代わりすれば、翌朝には「遅れているエリア」「図面とのズレ」「安全上の是正指示」がすでに整理された状態でダッシュボードに並びます。
監督の役割は、データを集める作業員から、AIが弾き出した分析結果をもとに現場全体を最適化する「指揮官」へとシフトしていくことになります。「仕事が奪われる」というより、「付加価値の低い作業から解放される」と捉えたほうが実態に近いでしょう。
まとめ:フィジカルAIは建設業だけの話ではない
Torch Towerの事例は建設業の話ですが、「認知・判断・行動」を統合したフィジカルAIの構造そのものは、物流、製造、小売など、あらゆる現場仕事に応用が効く汎用的な仕組みです。今後は自分の業界でも「どの作業がAIに置き換わり、どの判断だけが人間に残るのか」を見極める視点が重要になってきます。
この構造変化をどう読み解き、個人がどうキャリア戦略を立てるべきか——より踏み込んだ分析は、有料マガジンで詳しく解説しています。
👉 Substack「AI時代の建築家の生き方」で詳しく読む
関連記事:
