初めて見る部品でも、ロボットは組み立てられるか―世界モデルの56%と、人間との比較
部品を「はめる」だけでも、ロボットには難しい
見慣れないケーブルの差し込み口を探したり、家具の部品を穴に合わせたりするとき、私たちは形や向きを見ながら手を動かします。うまく入らなければ、少し戻して角度を変えるでしょう。簡単そうに見える「はめる」という作業にも、位置を合わせ、動きを調整する過程があります。
今回紹介するのは、こうした作業をロボットに覚えさせる研究です。目指しているのは、練習した部品だけでなく、初めて扱う部品にも対応できること。では、そのためにどのような仕組みを使い、何ができるようになったのでしょうか。

InsertionWMとAutoMateは、何の名前か
まず、この研究に登場するInsertionWM(インサーション・ダブリューエム)は、研究チームが開発した「ロボットに部品のはめ方を学ばせ、動かすための仕組み」の名前です。ロボット本体の商品名ではありません。研究では、この新しい仕組みを、以前の研究で開発されたAutoMate(オートメイト)という仕組みと比べています。[1]
AutoMateも、ロボットに組み立て作業を学ばせるための研究です。部品ごとに練習して身につけた動かし方を、複数の部品に対応できる一つの仕組みにまとめる方法などを扱っています。決められた動きをただ繰り返すだけの装置ではなく、こちらも学習によって作業を覚えるものです。[3]
両者を理解するうえで注目したい違いは、今回の新しい仕組みが「こう動かしたら、その先はどうなるか」を予測して動きを選ぶことです。この予測を受け持つのが、世界モデルと呼ばれる仕組みです。[1][2]
世界モデルとは、「動かした結果」を予測する仕組み
例えば、穴にはまりかけた部品が途中で止まった場面を想像してみてください。そのまま押すのか、少し持ち上げるのか、角度を変えるのか。動かし方によって、その後の状態は変わります。世界モデルは、そうした行動と結果の関係を学び、次にどう動くとよさそうかを考えるために使われます。[2]
名前に「世界」と付いていますが、世の中のすべてを理解するという意味ではありません。ここでは、作業に必要な範囲で、動かした先を予測するものと考えると分かりやすいでしょう。人間が「少し傾けたら入りそうだ」と見当をつける場面にたとえられますが、人間と同じ考え方や感覚を持つと確かめられたわけではありません。
初めての部品で、どれくらい成功したのか
研究チームは、最大90種類の部品の組み合わせで練習させ、その練習に使わなかった10種類で試しました。新しい部品専用の練習を追加しない条件で、成功率は平均56%。論文が比較に挙げたAutoMateの成功率は7%でした。いずれも、ここで比べているのはコンピューター内に再現したロボットと部品を使う実験の成績です。[1]
なお、7%はAutoMateが組み立て作業全般でこの程度しか成功しない、という数字ではありません。AutoMateの元の研究では、学習した部品を対象に高い成功率も報告されています。今回は「練習していない部品にも対応できるか」という条件に注目した比較です。[3]
この違いは、練習問題を解けることと、初めて出された問題に応用できることの違いにたとえられます。ただし、二つの仕組みは利用する情報や学習方法も異なるため、成績の差をすべて世界モデルだけの効果と考えることはできません。
何も教えず、組み立てを任せたわけではない
実験では、ロボットがすでに部品をつかんだ状態から、相手の部品にはめ込む作業を行います。カメラで得る距離の情報に加え、はめ込む相手がある位置や向き、目標位置の情報も使います。また、試した部品は、練習に使ったものと同じデータ集から取り分けたものです。[1]
つまり、知らない機械をばらばらの状態で渡され、部品の役割や組み立て順序まで自分で考える、という課題ではありません。「この部品を、こちらにはめる」という作業の中で、形が変わっても対応できるかを調べています。ここを押さえると、研究でいう「初めて」の意味が見えてきます。
では、人間なら簡単にできるのか
この論文には、人間に同じ作業をさせて成功率を比べた実験はありません。[1] ここからは、その結果をどう受け止めるかについての考察です。56%という数字を見ると「まだ半分近く失敗するのか」と感じますが、人間でも本当に初めて見る部品ならどうなのか、という疑問は残ります。
突起と穴の形を見れば入れ方が分かる部品なら、専門知識がなくても対応できる場合はあるでしょう。一方、外から向きの違いを見抜きにくかったり、ほんの少しのずれで引っかかったり、見えない内部に特殊な仕組みがあったりすれば、話は変わります。使い方を知らなければ、詳しい人でも迷う可能性があります。
そのため、「初めて見る部品でも人間なら簡単」とは言い切れません。ただし、「専門家でなければ成功率は低い」と決めることもできません。部品の難しさに加え、説明を受けられるか、何度試せるか、どのくらい時間があるかによっても結果は変わるはずです。
人間と公平に比べるなら、こうした条件をそろえる必要があります。さらに、人間が直接触って作業する場合と、画面だけを見てロボットを操作する場合も分けて考えたいところです。成功率だけでなく、かかった時間や部品を傷つけずに済んだかも測れば、実際の作業としての得意・不得意が分かりやすくなるでしょう。
練習した経験を、新しい部品にも使えるように
この研究を読むうえで大切なのは、人間との勝ち負けを決めることよりも、練習した経験を別の部品にどこまで応用できるかという点です。もし新しい部品が来るたびに、動かし方を最初から覚え直さなければならないなら、その準備に手間がかかります。少し形が違っても、それまでの経験を使えるようになれば、ロボットに任せられる仕事を広げられるかもしれません。
もちろん、実際の工場で使うには、繰り返し安定して成功することや、失敗したときの立て直しも必要です。今回の結果を、そのまま現実の作業で得られる成績と考えることはできません。それでも、「練習したものだけを扱う」段階から、経験を新しいものに応用する段階へ進めるかを考える、具体的な材料になります。
人間も、初めての部品を扱うときに、過去の経験を手がかりにするでしょう。ロボットが同じように経験を応用できるようになるには何が必要なのか。世界モデルという技術は、その問いに「動かした先を予測する」という方法で取り組んでいます。
こういった研究は工場もそうですが、日常的にどれだけの予測不可能な状況で、それに対処できるのか、という問題と直結すると思います。人間が本質的に無意識で対応できるようなことというのは実はたくさん洗いますが、ロボットは考えてやるということの中に、人間であれば無意識でできることも含んでいるのだというのが、極めて大変な事ではないかと思います。