リコー 動画像から人の動きを学習しさまざまなロボットに適用可能なフィジカルAI技術を開発 シミュレーション環境で有効性を確認
株式会社リコーは、人間やロボットの作業動画などの動画像データから、ロボットの機構や身体構成に依存しない行動表現を学習するフィジカルAI技術を開発した。同技術では、Latent Action Model(LAM、潜在行動モデル)※1を活用して、人間やロボットの作業動画から「物を持つ」「前進する」「対象を移動させる」などの行動を共通表現として学習する。仮想環境上に構築したシミュレーション環境で有効性を確認しており、今後は実環境での検証を進めながら、さまざまな作業や環境への適用可能性を評価していく。
なお同開発は、アマゾン ウェブ サービス ジャパン合同会社(AWSジャパン)の「フィジカルAI開発支援プログラム by AWSジャパン」を通じて提供された計算リソースおよび技術支援を活用しながら進めてきたものとなっている。
※1 LAM(Latent Action Model):画像や動画の変化から、観測データには明示されていない「潜在的な行動」を学習するAIモデル。行動を示すラベルが付与されていない動画データも活用できる可能性があり、フィジカルAIにおけるロボットの事前学習や行動生成などへの応用が期待されている
フィジカルAIでAI活用領域を実世界へ拡張
リコーは、創業以来、顧客の“はたらく”に寄り添い、「機械にできることは機械に任せ、人はより創造的な仕事に取り組む」という考えのもと、働く人を支援してきた。長年にわたりグローバルでドキュメントソリューションを展開し、文書画像処理や情報活用に関する技術・知見を蓄積している。近年は、企業や現場に蓄積された知識を安全に活用できるプライベートLLM/LMM技術の開発を進めるなど、AIを活用した業務変革の支援に取り組んでいる。
一方で、製造、物流、保守などの現場では、人手不足や熟練者の知見継承といった課題に加え、完全自動化が困難な業務が依然として多く残っている。そのため、現場の状況を認識し、判断しながら柔軟に作業できるAIとロボティクスの融合技術である「フィジカルAI」への期待が高まっている。リコーは、これまで培ってきたAI・画像認識技術の強みを生かし、AI活用領域をデジタル空間から実世界へ拡張する取り組みとして、フィジカルAIの研究開発を進めている。
LAMを活用し、多様なロボットへの適用可能性を向上
「フィジカルAI」開発において、現在のVLA(Vision-Language-Action、視覚・言語・行動)※2モデルは、実際の現場で活用するためには現場課題ごとにモデルのチューニングが必要となるケースが多く、実機データの収集が負荷となっている。また、ロボットの構成(ヒューマノイド、腕部、2指/5指ハンド等)によって行動の表現形式や制御仕様が異なるため、ロボットごとに学習データを集め直す必要があり、スケーラブルな導入の妨げとなっていた。特に、ヒューマノイドロボットにおける実機データの不足は大きな課題となっている。
今回リコーは、ロボットの機構や身体構成に依存しない行動表現を学習する「Latent Action Model(LAM)」を活用し、汎用性の向上を目指したフィジカルAI技術を開発した。
LAMでは、人間やロボットの作業動画などから、「物を持つ」「前進する」「対象を移動させる」といった行動を、ロボット固有の制御方式に依存しない共通表現として学習する。この行動表現をVision-Language Model(VLM)※3の学習に活用することで、多様なロボットやタスクへの適用可能性を高めたVLAモデルの生成を実現した。LAMの学習には、人間の作業動画データを活用し、実機データ収集のコストを抑えながら、行動表現の再利用性向上を図っている。また、シミュレーション環境で学習した成果を実機へ展開するSim2Real技術を活用することで、実機ロボットへの迅速な導入を目指す。
同開発では、AWSのクラウド技術を活用し、効率的な学習環境を構築した。Amazon EC2やAmazon S3などのサービスを活用することで、大規模なデータ処理やモデル学習を効率的に実施した。

※2 VLA(Vision-Language-Action):画像や動画などの視覚情報と言語による指示を理解し、ロボットの具体的な動作を生成するAIモデル。「見る・理解する・動く」を統合的に扱うことで、多様な状況や作業への柔軟な対応を目指す
※3 VLM(Vision–Language Model):画像やテキストなど複数の形式の情報を組み合わせて処理するAIモデル
今後の展望
フィジカルAIの実用化は、AIモデルの性能向上だけでなく、現場特有の変化や制約を踏まえ、人にとって安全で信頼できる形で価値を提供することが重要となる。
リコーは、これまで培ってきた画像認識・文書理解・AI活用の技術資産を基盤に、今後は、オフィス、工場、物流、保守などの現場を想定し、さまざまな作業や最適なロボット構成についての検証を進める。実際の現場での社内実践を踏まえて、フィジカルAIの社会実装に向けて取り組むとしている。
リコーは企業理念の使命と目指す姿として掲げる「“はたらく”に歓びを」の実現に向けて、人とロボットが協働することで、人が判断や創造性を発揮すべき業務により多くの時間を充てられる働き方の実現を目指す。人とAI、デジタルとフィジカルが自然につながる新たな価値創出に取り組み、持続可能な社会の実現に貢献する。
「フィジカルAI開発支援プログラム by AWSジャパン」について
同プログラムは、AWS上でVision-Language-Action(VLA)などのロボット基盤モデルを開発する、日本に法人または拠点を持つ企業・団体を対象としたAWSジャパンの取り組み。データ収集・前処理からモデルトレーニング、シミュレーション、実環境へのデプロイまでの一連のパイプライン構築を支援し、AIのロボティクス分野への活用を推進することを目的としている。採択企業は、AWSクレジットの提供、フィジカルAI領域スペシャリストによる技術支援、ロボティクス・生成AIコミュニティへの参加、およびGo-to-Market(GTM)支援を受けられる。リコーは、2026年3月に同プログラムに採択され、フィジカルAIの開発に取り組んできた。
プログラム詳細:https://aws.amazon.com/jp/blogs/news/aws-japan-physical-ai-development-support-program/
関係者コメント
【株式会社リコー 経営企画本部AIサービス事業部 事業部長 梅津良昭氏】
このたび、「フィジカルAI開発支援プログラム by AWSジャパン」に採択いただき、AWSの技術支援や知見を活用しながら研究開発を推進できたことを大変嬉しく思います。本プロジェクトを通じて、フィジカルAI領域における技術検証を加速し、新たな可能性を見出すことができました。今後もリコーは、「“はたらく”に歓びを」の実現に向け、AIと現実世界をつなぐ技術の開発を進め、人とAIが協調する持続可能な社会の実現に貢献してまいります。
【アマゾン ウェブ サービス ジャパン合同会社 常務執行役員 技術統括本部長 巨勢泰宏氏】
リコー様が『フィジカルAI開発支援プログラム by AWSジャパン』を通じ、ロボットの身体構成に依存しないフィジカルAI技術を開発されたことを大変嬉しく思います。2023年にAWSジャパンが実施した『AWS LLM開発支援プログラム』でリコー様が出された先駆的成果に続く本挑戦は、AWSとの継続的な協創の新たなマイルストーンです。Latent Action Modelにより多様なロボットに適用可能な行動表現を獲得するアプローチは、フィジカルAIの実用化に大きく貢献します。AWSは学習基盤構築と専門技術支援でリコー様に伴走してまいりましたが、今後もリコー様の『”はたらく”に歓びを』と人とロボットが協調する社会の実現に向けたお取り組みを支えてまいります。
この記事をシェアする