LDA-1B 설명: “가비지 데이터'가 차세대 로봇 AI의 혁신을 이끄는 방법

“가비지 데이터'가 어떻게 차세대 로봇 AI의 혁신을 이끌고 있는지 설명하는 LDA 1B

로봇 파운데이션 모델을 둘러싼 경쟁에 새로운 주자가 등장했다. 베이징대학교, 칭화대학교, 갤럭시 제너럴, 지위안 연구소로 구성된 합동 연구팀이 LDA-1B, 매개변수 규모를 곧바로 10억 단위로 끌어올렸다.

이 수치 뒤에는 더 과감한 아이디어가 숨어 있습니다. 바로 전문가의 시연 데이터에만 집중하는 것을 그만두자는 것입니다. 예전에는 휴지통으로 버려지곤 했던 그 “쓰레기 데이터” 조각들이, 사실 로봇에게 정말로 필요한 영양분일지도 모릅니다.

로봇의 전통적인 훈련 방식은 간단합니다. 숙련된 조작자를 찾아 그 동작을 기록한 뒤, 로봇이 이를 모방하여 학습하도록 하는 것입니다. 이러한 행동 복제 방식은 OpenAI와 Google DeepMind에서 널리 사용되어 왔습니다. 하지만 문제는 명백합니다. 데이터 활용도가 극히 낮다는 점입니다.

로봇 제작 시도가 실패했나? 버렸다.
무심코 찍은 사람 작업 영상? 화질이 좋지 않으니 버리자.
다른 로봇 플랫폼의 데이터인가요? 호환되지 않는 형식이라 여전히 삭제되었습니다.

그리고 LDA-1B 팀은 간단한 질문을 던졌습니다. “그렇게 낭비되고 있는 데이터를 실제로 활용한다면 어떤 일이 벌어질까?”


LDA-1B가 이용 가능한 모든 데이터를 활용하는 방법

연구진은 ‘EI-30k’라는 데이터셋을 구축했는데, 이는 인간의 조작과 로봇의 궤적을 모두 아우르는 30,000시간 분량의 체화 상호작용 데이터로 구성되어 있다.

로봇공학 분야에서 이 데이터셋의 규모는 이미 어마어마한 수준입니다. 비교를 위해 말하자면, 이전까지 가장 큰 데이터셋이었던 ‘Open X-Embodiment’는 1,000시간을 약간 넘는 수준이었습니다.

하지만 규모가 핵심은 아닙니다. 핵심은 다양성입니다.

이 데이터셋에는 다음이 포함됩니다:

  • 성공적인 시연과 실패한 시도
  • 고정밀 로봇 데이터와 대충 촬영한 사람의 동영상
  • 양팔 조작 및 정교한 손 동작

기존 기준에 따르면, 이 데이터의 상당 부분은 일관성이 없어 훈련 데이터셋에 포함될 수 없을 것입니다.

LDA-1B 다른 접근 방식을 취합니다. 즉, 품질이 다른 데이터에 서로 다른 역할을 할당하는 것입니다.

정책을 학습하기 위해 고품질의 전문가 시연이 활용됩니다.
물리적 세계의 역학을 파악하기 위해 품질이 낮거나 “부적합한” 데이터가 사용됩니다.

잡기에 실패한 영상을 그대로 모방할 수는 없지만, 이 영상은 모델에게 “이런 식으로 잡으면 실패한다”는 정보를 전달합니다. 이것이 바로 동적 지식입니다.

이 아이디어는 간단해 보이지만, 기술적인 난제를 제기합니다:
어떻게 LDA-1B “다음 프레임이 어떻게 보이는지”와 “다음에 어떤 행동을 취해야 하는지”를 동시에 파악할 수 있을까요?


LDA-1B와 DINO 잠재 공간에서의 예측

이 팀이 제시한 해결책은 예측 작업을 DINO의 잠재 공간으로 옮기는 것이다.

메타(Meta)가 개발한 시각적 자율 학습 모델인 DINO는 이미지를 매우 추상적인 특징 표현으로 압축합니다. 이 공간에서, LDA-1B “테이블이 나무로 된 것인지, 흰색인지”와 같은 표면적인 세부 사항에는 신경 쓸 필요가 없으며, 대신 “물체가 어디에 있는지”와 “어떻게 움직이는지”와 같은 핵심적인 물리적 정보에 집중합니다.”

이 설계는 두 가지 장점을 제공합니다:

  • 픽셀 단위의 중복을 피함으로써 계산 효율이 훨씬 높아집니다.
  • 환경 간 일반화 능력이 더 뛰어나기 때문에, LDA-1B 장면별 시각적 특징 대신 추상적인 물리적 법칙을 학습한다

통합된 다중 모드 확산 트랜스포머 프레임워크 내에서, 이 모델은 액션 청크와 향후 DINO 시퀀스의 노이즈를 동시에 제거합니다.

이질적인 데이터는 다음 분야에서 독특하고 상호 보완적인 역할을 수행합니다:

  • 시각적 예측
  • 역학 학습
  • 정책 학습

연구팀은 다양한 이벤트 지속 시간과 조작 작업을 아우르는 30,000시간 이상의 다양한 인간-로봇 상호작용 데이터를 담은 EI-30k 데이터셋을 수집했다.

건축적인 측면에서, LDA-1B 다중 모드 확산 트랜스포머(Multi-modal Diffusion Transformer)를 사용합니다. 이를 통해 비동기적인 시각 및 동작 스트림을 처리할 수 있습니다. 실제 환경에서는 카메라 프레임 속도와 로봇 제어 주파수가 종종 일치하지 않는데, 기존 모델들은 이를 처리하는 데 어려움을 겪습니다.

또한 확산 모델링을 도입함으로써 다음이 가능해집니다. LDA-1B 10억 개 규모의 매개변수 수준에서 안정적으로 학습할 수 있도록 하는 것—이는 이전에는 로봇 모델에 있어 어려운 과제였다.


세 가지 과제 범주에 걸친 LDA-1B의 성능

평가를 위해 연구팀은 다음의 세 가지 대표적인 시나리오를 선정했습니다:

LDA-1B의 상호작용이 풍부한 과제

이러한 테스트는 로봇의 힘에 대한 인식 및 제어 능력을 평가하는 것으로, USB 케이블을 꽂거나 나사를 조이는 등 정밀한 힘 피드백이 필수적인 작업들을 포함합니다.

LDA-1B 이전 π0.5 모델보다 21% 더 우수한 성능을 보입니다.

LDA-1B를 활용한 정교한 조작

더욱 어려운 점은, 이러한 작업들이 루빅스 큐브를 돌리거나 도구를 사용하는 것과 같이 여러 손가락을 조화롭게 움직여야 한다는 점입니다.

여기서, LDA-1B 더 큰 이점을 보여주며, 성능을 48% 향상시켰습니다.

LDA-1B에서의 장기 계획 수립

이 과제들은 계획 수립 능력을 평가합니다. 로봇은 최종 목표를 달성하기 위해 일련의 하위 과제를 완료해야 합니다.

LDA-1B 이 부문에서 23%의 향상을 달성했다.

더 흥미로운 점은 미세 조정 실험들이다.

연구팀은 의도적으로 “저품질” 데이터, 즉 일반적으로는 버려지는 실패 사례나 불완전한 경로 데이터를 사용했다.

결과: 이 데이터 중 30%만 사용했음에도 성능이 10% 향상되었습니다.

이 연구 결과는 업계에서 널리 통용되던 통념을 뒤집는 것이다:
소위 “쓰레기 데이터”는 부담이 아니라, 오히려 ~에 있어 숨겨진 자산이 될 수 있습니다. LDA-1B.


LDA-1B와 세계 모델로 향하는 새로운 길

그 배후에 있는 기술적 접근 방식은 LDA-1B 이는 더 큰 질문, 즉 ‘로봇 파운데이션 모델은 어떻게 학습해야 하는가?’에 대한 답을 제시합니다.

현재 두 가지 주요 패러다임이 있습니다:

행동 복제
OpenAI의 로봇 공학 연구와 Physical Intelligence의 π0 시리즈가 이를 대표합니다. 그 원리는 간단합니다. 전문가의 행동을 관찰하고 이를 모방하는 것입니다.

월드 모델
『Genie』와 『DIAMOND』 같은 작품들이 이를 잘 보여줍니다. 핵심은 먼저 물리적 세계가 어떻게 작동하는지 이해한 다음, 어떻게 행동할지 결정하는 것입니다.

행동 복제는 데이터 효율성이 낮은 단점이 있는데, 성공 사례만을 통해 학습하기 때문이다.
기존 모델들은 조잡한 구현 방식 때문에 어려움을 겪어 왔는데, 이는 동작을 배제하고 영상 예측에만 집중하거나, 대규모 훈련에 비해 데이터셋의 규모가 너무 작다는 점 때문이었다.

LDA-1B 세 번째 길을 택한다.

이 방법은 역학 학습, 정책 학습, 시각적 예측을 단일 프레임워크로 통합하여, 서로 다른 품질의 데이터가 각기 다른 역할을 수행할 수 있도록 합니다.

이 아이디어, 즉 ‘통합 세계 모델’은 이론적으로 이미 제안된 바 있다. 하지만 LDA-1B 10억 개 매개변수 규모에서 안정적인 훈련을 통해 이를 최초로 구현한 사례입니다.

공학적인 관점에서 볼 때, 의 가장 큰 공헌은 LDA-1B 단 한 번의 획기적인 성과가 아닙니다. 이는 한 가지 사실을 입증하고 있습니다:

로봇 파운데이션 모델은 언어 모델과 마찬가지로 방대한 양의 이종 데이터를 “소비”함으로써 확장성을 확보할 수 있다.

예전에는 낭비되곤 했던 데이터를 내부에서 지식으로 전환할 수 있습니다 LDA-1B.


LDA-1B가 데이터 부족 문제를 해결할 수 있을까?

로봇 공학 분야는 오랫동안 ‘데이터가 비싸다’는 곤란한 현실에 직면해 왔다.

고품질의 로봇 시연 데이터를 1시간 분량 녹화하려면 숙련된 운영자, 표준화된 환경, 정밀한 센서가 필요합니다. 이에 드는 비용은 수천 달러에 달할 수 있습니다.

자금이 넉넉한 연구실조차도 언어 모델 수준의 방대한 데이터로 모델을 훈련시키는 데 어려움을 겪고 있다.

LDA-1B 새로운 방향을 제시합니다.

완벽한 데이터를 수집하기 위해 막대한 비용을 지출하기보다는, 불완전한 데이터를 활용하십시오.

유튜브에 업로드된 사람이 직접 조작하는 영상, 디버깅 과정에서 실패한 로봇 시연 영상, 다양한 연구실과 플랫폼에서 수집된 데이터 세트 등—이전에 간과되었던 이러한 자료들은 이제 다음을 위한 훈련 자료가 될 수 있습니다. LDA-1B.

그렇긴 하지만, 여전히 몇 가지 불확실한 점이 남아 있습니다.

이 논문은 EI-30k 데이터셋의 구성과 출처를 완전히 공개하지 않고 있어, 이를 재현하려는 다른 팀들에게 장애물이 되고 있다. LDA-1B 이 정도 규모에서.

또한 배포 문제도 있습니다. 10억 개의 매개변수를 가진 모델은 상당한 계산 비용을 수반합니다. 로봇은 서버와 달리 단순히 연산 능력을 확장할 수 없습니다.

그래도 지금 이 순간, LDA-1B 로봇 기초 모델에 대한 새로운 기준을 제시합니다:

  • 더 큰 규모
  • 더 다양한 데이터
  • 보다 통일된 방법들

이제 문제는 다른 참가자들이 이에 어떻게 대응할 것인가 하는 점입니다. LDA-1B.

위로 스크롤