대체로 로봇 기술을 자율적으로 습득하는 기존 방법은 성능이 가장 뛰어난 단일 해를 찾는 데 초점을 맞춘다. 그러나 조작 작업 공간은 차원이 매우 높기 때문에 이러한 방법을 실제 환경에 적용하면 취약성이 나타날 수 있으며, 이 기법을 기반으로 커리큘럼을 구성하려면 세심한 설계가 필요하다. 반면 품질-다양성 파이프라인으로 얻은 모션 프리미티브는 다양한 해를 제공하므로 별도의 조정 없이도 통합하기에 적합하다. 하지만 유용하면서도 작업에 특화된 다양성 지표와 적합도 신호를 설계하려면 여전히 전문가의 노력이 필요하며, 이는 자율성이라는 요구와 양립하기 어렵다. 언어 모델 기반 보상 셰이핑 기법을 조작 작업을 위한 품질-다양성 알고리즘에 적용하면, 자유 형식의 지시를 지원하면서도 다양한 해의 아카이브를 구축할 수 있다.
로보틱스의 궤적 데이터셋
대체로 로봇 기술을 자율적으로 습득하는 기존 방법은 성능이 가장 뛰어난 단일 해를 찾는 데 초점을 맞춘다. 그러나 조작 작업 공간은 차원이 매우 높기 때문에 이러한 방법을 실제 환경에 적용하면 취약성이 나타날 수 있으며, 이 기법을 기반으로 커리큘럼을 구성하려면 세심한 설계가 필요하다.
반면 품질-다양성 파이프라인으로 얻은 모션 프리미티브는 다양한 해를 제공하므로 별도의 조정 없이도 통합하기에 적합하다. 하지만 유용하면서도 작업에 특화된 다양성 지표와 적합도 신호를 설계하려면 여전히 전문가의 노력이 필요하며, 이는 자율성이라는 요구와 양립하기 어렵다.
언어 모델 기반 보상 셰이핑 기법을 조작 작업을 위한 품질-다양성 알고리즘에 적용하면, 자유 형식의 지시를 지원하면서도 다양한 해의 아카이브를 구축할 수 있다.
방법
이 절에서는 먼저 로봇 기술 아카이브 설계 문제를 형식화하고, 로봇 기술 습득을 위한 MAP-Elites-Success 알고리즘의 매개변수화를 정의한다. 이어 전문가의 입력이나 작업별 조정 없이 언어 모델을 사용해 행동 기술자 공간과 적합도 공간을 순차적으로 탐색하는 기법을 제안한다. 마지막으로 생성된 행동 기술자 샘플의 메시를 다중 행동 기술자 MAP-Elites-Success 알고리즘에 활용하면, 주어진 작업에 대해 다양한 모션 프리미티브의 아카이브를 생성할 수 있다.
로보틱스용 궤적 데이터셋 생성
작업은 알려져 있지만 작업 인스턴스의 분포는 알려져 있지 않다고 하자. 이때 로봇 품질-다양성 설계 문제는 다음과 같이 정의된다.
알려지지 않은 작업 인스턴스 분포 전반에서 작업 요구사항을 충족하는 모션 프리미티브 아카이브를 찾아라.
여기서 모션 프리미티브 아카이브는 로봇 행동 후보들의 모음이며, 모션 프리미티브 공간은 가능한 모션 프리미티브 전체가 이루는 공간이다.

다중 BD MAP-Elites-Success를 위한 LLM 추론
이 절에서는 언어 모델을 사용해 품질-다양성 알고리즘을 매개변수화하는 전략을 소개한다.
최종 아카이브의 품질을 위해 올바른 성공 기준을 확보하는 일은 매우 중요하지만, 설계 자체는 비교적 쉽다. 따라서 작업마다 성공 조건 하나만 추론해 계산량을 줄인다.
실험
이 절에서는 실험에 사용한 제안 알고리즘의 구현을 자세히 설명하고, 방법을 검증하기 위한 실험 환경을 소개한다.

구현: 인식 API
언어 모델에는 다음 정보가 제공된다.
- 물체 본체의 위치와 방향. 언어 모델과 같이 비전문적인 시스템이 해석하기 쉽도록 오일러각을 사용한다.
- 테이블과 로봇, 그리고 테이블과 물체 사이의 접촉 정보.
- 로봇 그리퍼와 물체의 각 링크 사이의 접촉 정보. 비관절형 물체의 경우에는 그리퍼와 물체 본체 사이의 접촉 정보가 제공된다.
- 로봇 그리퍼의 위치와 방향.
- 관절형 물체의 경우 각 관절의 위치. 관절의 각도 또는 직선 변위로 표현한다.
환경과 작업
전문가가 정의한 성공 조건: 물체는 그리퍼에 닿아야 하며 테이블에는 닿지 않아야 한다.
정답 행동 기술자: 물체와 처음 접촉하는 순간의 그리퍼 XYZ 위치.

평가 지표
성공 아카이브 크기
각 실행에서 전문가가 작성한 성공 조건을 기준으로 성공한 개체의 수를 측정한다.
정답 행동 기술자 커버리지
각 작업에 대해 각 베이스라인의 출력 아카이브를 수작업으로 정의한 베이스라인에서 사용한 정답 행동 기술자 공간에 투영한다. 이 정답 행동 기술자 공간은 작업에 접근하는 방식의 의미 있는 다양성을 포착하도록 수작업으로 설계되며, 실제 해의 다양성을 측정하는 지표를 제공한다.
자주 묻는 질문
언어 기반 품질-다양성은 어떤 문제를 해결하는가? 전문가가 작업별 다양성 지표와 적합도 신호를 설계하지 않아도 다양한 로봇 조작 기술을 자율적으로 습득할 수 있도록 한다.
다양한 모션 프리미티브가 로봇 조작에 유용한 이유는 무엇인가? 다양한 해를 제공하므로 별도의 조정 없이 통합하기에 적합하며, 차원이 높은 조작 작업 공간에서 발생하는 취약성을 줄일 수 있다.
언어 모델에는 어떤 정보가 제공되는가? 언어 모델은 물체의 자세, 접촉 정보, 그리퍼의 자세, 관절형 물체의 관절 위치를 입력으로 받는다.
정답 행동 기술자 커버리지는 어떻게 측정하는가? 출력 아카이브를 작업 접근 방식의 의미 있는 다양성을 포착하는 수작업 정의 정답 행동 기술자 공간에 투영해 측정한다.
