LingBot-Map, 저렴한 카메라 한 대만으로도 완벽한 3D 지도를 구축 — 10,000 프레임, 오류 제로

lingbot map은 저렴한 카메라 한 대만으로도 완벽한 3D 지도를 구축합니다 — 10,000 프레임, 오류 제로

중국 연구팀이 ‘LingBot-Map’을 오픈소스로 공개했는데, 이 시스템은 일반 카메라 하나만으로도 1만 프레임의 스트리밍 3D 재구성을 달성하며 인터넷 전역에서 120만 명의 시청자를 끌어모았다.

불과 수십 위안짜리 카메라가 수만 위안짜리 라이다(LiDAR) 시스템을 능가한다.

의외로, 중국 팀이 오픈소스로 공개한 ‘LingBot-Map’이 전 세계 로봇 공학계에 즉각적인 반향을 불러일으켰다.

이 모델은 스트리밍 방식의 3D 재구성 기반 모델입니다. 라이다(LiDAR)나 깊이 센서 없이 RGB 카메라 하나만으로도 초당 20프레임(FPS)의 속도로 실시간으로 완전한 3D 지도를 구축합니다.

링봇, 지도, 긴 시퀀스, 공간 기억

가장 눈에 띄는 점은, 10,000 프레임을 연속으로 실행한 후에도 정확도가 거의 떨어지지 않는다는 것입니다.

애질리티 로보틱스의 한 AI 연구원은 “이 날을 너무 오랫동안 기다려왔다”고 말했다.”

애질리티 로보틱스의 한 AI 연구원은 “이 날을 너무 오랫동안 기다려왔다”고 말했다.”

앤드류 데이비슨조차 직접 나서서 이를 칭찬했다:

이 작업에는 인상적인 SLAM 기법이 적용된 것 같네요. 훌륭한 성과를 거두신 것을 축하드립니다.

데이비슨은 특정 엔지니어링 프로젝트에 대해 공개적으로 언급하는 일이 거의 없다. 그가 적극적으로 어떤 게시물을 공유하며 “인상적이다”라는 표현을 사용할 때면, 해당 분야의 사람들은 이를 유심히 살펴보게 된다.

이미지

LingBot-Map, SLAM 업계에 파란을 일으키다 — 업계 리더들, “드디어”라고 입을 모은다”

LingBot-Map은 로봇이 세상 전체를 진정으로 “이해”할 수 있게 해줍니다. 이 프로젝트의 오픈소스 공개에는 120만 명이 방문했습니다.

여러 유명 KOL들이 해당 게시물을 리포스트하고 ‘좋아요’를 누르면서, 업계 전반에서 큰 주목을 받았습니다.

그렇다면 SLAM 분야의 선구자로부터 찬사를 받았고 연구자들이 오랫동안 기다려온 LingBot-Map은 실제로 어떻게 작동할까요?

이 팀이 공개한 실전 테스트 결과가 그 해답을 제시합니다.

공중 촬영 장면에서 카메라는 상공에서 도시의 한 블록 전체를 훑어봅니다. LingBot-Map은 건물 외관, 지붕 구조, 도로, 길가의 나무 등을 실시간으로 완전한 3D 포인트 클라우드로 재구성하며, 심지어 옥상에 설치된 에어컨 유닛까지 식별할 수 있습니다.

실내 내비게이션 시나리오에서 카메라는 주방에서 거실로 이동한 뒤 복도를 지나갑니다. 조명과 구조가 끊임없이 변하지만, 재구성된 다중 공간 3D 지도는 공간적으로 정확하게 정렬되어 있으며, 방들 사이에 정렬 오류나 고스트 현상이 발생하지 않습니다.

조명이 어두운 복도는 극한의 시험대가 됩니다. 카메라가 거의 칠흑같이 어두운 좁은 복도를 통과합니다. 기존의 비전 기술은 대개 이곳에서 실패하지만, LingBot-Map은 여전히 일관된 복도 구조와 안정적인 궤적을 출력합니다.

더 흥미로운 점은, 연구팀이 LingBot-World로 생성된 만화 스타일의 영상을 LingBot-Map에 입력했음에도 불구하고, 여전히 안정적인 3D 재구성을 완료했다는 사실이다.

입력 데이터는 AI가 생성한 가상 일본 거리입니다. 출력 결과는 정확한 공간 좌표를 가진 3D 포인트 클라우드입니다. 두 모델 간의 호환성은 “가상 세계 → 3D 공간 이해”로 이어지는 파이프라인을 직접 연결합니다.”

궤적 비교를 통해 그 점이 더욱 명확해집니다.

Oxford Spires 및 Tanks & Temples 데이터셋에서 LingBot-Map이 예측한 궤적(주황색)은 실제 궤적(파란색)과 거의 완전히 일치하는 반면, 경쟁 모델인 TTT3R과 WinT3R은 심각한 편차를 보인다.

LingBot-Map 내부 — “선택적 기억” 시스템

3D 재구성 스트리밍의 핵심적인 어려움은 단 한 가지입니다. 바로 과거 정보를 잃어버리지 않으면서도 메모리를 소진시키지 않은 채, 모델이 “보면서 구축”할 수 있도록 하는 방법입니다.

기존의 3D 재구성 방식은 “먼저 촬영하고, 나중에 처리한다”는 방식입니다.”

스트리밍 재구성을 위해서는 시스템이 새로운 프레임을 수신하는 동안 지속적으로 위치 파악 및 매핑을 수행해야 하며, 이 모든 과정에서 계산 및 메모리 비용을 엄격하게 제어해야 합니다.

기존의 해결책들은 상충 관계에서 벗어나지 못했습니다.

일부는 지나치게 과도한 압축을 적용하다가 초기 관측값을 점차 잊어버리기도 했다. 또 다른 일부는 모든 과거 프레임을 캐시에 저장하여 시퀀스 길이에 따라 메모리 사용량이 선형적으로 증가하게 만들었다. 그 외에는 딥러닝 모델을 기존의 SLAM 백엔드와 결합했는데, 결과는 나쁘지 않았지만 수동 조정이 필요했고 실시간 성능이 부족했다.

LingBot-Map은 고전적인 SLAM에서 구조적 통찰력을 차용합니다.

알 수 없는 환경에서 이동하면서 지도를 구축하기 위해 로봇은 다양한 세부 수준에서 공간적 기억을 유지해야 합니다. 기존의 SLAM은 이를 관리하기 위해 수동으로 설계된 기하학적 제약 조건을 사용하므로 유연성이 제한됩니다.

LingBot-Map은 이러한 구조를 트랜스포머의 어텐션 메커니즘에 내재화하여, 모델이 무엇을 기억하고 무엇을 잊어야 할지 학습할 수 있도록 합니다.

이 메커니즘은 기하학적 컨텍스트 어텐션(GCA)이라고 불리며, 세 계층의 메모리를 유지합니다.

  1. 앵커 — “내가 시작했던 곳”을 기억하라.”
    처음 몇 개의 프레임은 GPS 기지국과 마찬가지로 좌표계와 스케일 기준선을 고정하는 앵커 프레임 역할을 합니다. 10,000번째 프레임에 이르러도 모델은 여전히 1번째 프레임의 위치를 파악하고 있습니다.
  2. 포즈 참조 창 — “주변에 무엇이 있는지” 기억하세요.”
    이 기능은 가장 최근의 수십 프레임을 완전한 시각 정보와 함께 저장하며, 마치 자동차 앞유리를 통해 바라보는 풍경처럼 현재 위치 주변의 정교한 기하학적 세부 사항을 포착합니다.
  3. 이동 경로 기억 — “내가 어디를 지나왔는지” 기억하기.”
    멀리 있는 프레임은 시각적 세부 정보를 모두 담지 않습니다. 각 프레임은 단 6개의 간결한 토큰으로 압축되어 전체 궤적의 핵심 기하학적 정보를 저장합니다. 마치 백미러와 같아서, 모든 집 번호를 볼 수는 없지만 어디에서 왔는지는 알 수 있습니다.

3단계 메모리 구조는 복잡해 보이지만, 실제로는 매우 효율적입니다.

10,000프레임 분량의 비디오의 경우, 표준 인과적 어텐션은 약 500만 개의 토큰을 캐시하는 반면, GCA는 약 7만 개만 사용합니다. 표준 방식에서는 새로운 프레임이 추가될 때마다 약 500개의 토큰이 추가되지만, GCA에서는 6개만 추가됩니다. 이로 인해 메모리 증가량이 약 80배 감소합니다.

바로 그 때문에 LingBot-Map은 메모리 사용량을 일정하게 유지한 채 초장편 동영상을 처리할 수 있는 반면, 다른 시스템들은 수천 프레임만 처리해도 오류가 발생합니다.

LingBot-Map 훈련 전략 및 벤치마크 결과

그림 1. LingBot-Map과 최신 스트리밍 재구성 기법 간의 비교.

연구팀은 2단계 훈련 전략을 사용했다.

1단계에서는 실내, 실외, 합성 및 실제 장면을 아우르는 29개의 데이터셋을 활용해 기본 모델을 학습시켜, 일반적인 기하학적 이해 능력을 구축했습니다.

2단계에서는 GCA를 도입하고 뷰 수를 24개에서 320개로 점진적으로 늘려, 모델이 먼저 짧은 시퀀스를 학습한 다음 긴 궤적을 학습할 수 있도록 했습니다.

이 논문은 평가 과정에서 5가지 벤치마크에 대한 결과를 보고하고 있다.

옥스퍼드 스파이어스(옥스퍼드 대학교에서 진행된 대규모 실내·실외 혼합 궤적 실험)에서 LingBot-Map은 6.42미터의 ATE 오차를 기록했으며, 이는 2위를 차지한 모델의 18.16미터에 비해 거의 3배나 더 우수한 성능이다.

특히, 이 정확도는 모든 프레임을 한 번에 처리하는 오프라인 방식(12.87)과 기존의 반복적 최적화 방식(10.52)을 모두 능가한다.

프레임 수를 320개에서 3,840개로 늘렸을 때, ATE는 6.42에서 7.11로만 증가하여 시퀀스 길이에 따른 성능 저하가 거의 없음을 보여줍니다.

ETH3D 데이터셋(레이저 스캔으로 확보된 실제 데이터 포함)에서 재구성 F1 점수는 98.98을 기록했으며, 이는 2위(77.28)보다 21퍼센트 포인트 이상 높은 수치입니다.

탱크와 사원(대형 야외 구조물)의 경우, ATE는 0.20미터인 반면 2위는 0.76미터입니다.

7-Scenes(실내 RGB-D)에서 ATE는 0.08미터로, 가장 우수한 결과를 기록했습니다.

로봇 공학 분야에서 LingBot-Map이 갖는 의미

학계는 ATE와 F1에 주목하지만, 로봇 기업들은 전혀 다른 방식을 따르고 있다.

첫 번째는 하드웨어 비용입니다.

산업용 LiDAR의 가격은 수천 달러에서 수만 달러에 달합니다. 여기에 IMU, 보정 툴체인, 소프트웨어 적용 비용을 더하면, 인식 기능만으로도 로봇 전체 비용의 3분의 1을 차지할 수 있습니다.

LingBot-Map에는 수십 위안 정도 하는 카메라만 있으면 됩니다.

가격 민감도가 극도로 높은 가정용 서비스 로봇이나 저속 배송 차량과 같은 분야의 경우, 라이더(LiDAR)를 제거하는 것이 칩을 하나 더 추가하는 것보다 훨씬 더 중요합니다.

두 번째는 장시간 자율 항법입니다.

대규모 물류 센터나 도시 환경에서 작동하는 로봇은 몇 시간 동안 연속으로 가동되어야 합니다. 기존 시스템은 장시간 연속 작동 시 메모리 한계에 부딪히게 됩니다.

LingBot-Map은 메모리 사용량을 일정하게 유지하면서 10,000프레임 이상을 처리할 수 있는 능력을 갖추고 있어, 넓은 공간에서 장시간 자율 주행이 가능해집니다.

또 다른 측면은 능숙한 조작 능력입니다.

이는 앞서 오픈소스로 공개된 LingBot-Depth와 연계됩니다.

로봇이 투명한 유리나 반사성이 강한 금속 용기를 잡으려고 할 때, 기존의 깊이 카메라들은 거의 “눈이 멀어” 버립니다. 이러한 재료들은 신뢰할 만한 신호를 반사하지 않아 깊이 맵에 큰 공백이 생기게 됩니다.

LingBot-Depth는 이 문제를 해결하기 위해 마스킹 깊이 모델링(MDM)을 사용합니다.

훈련 과정에서 깊이 맵의 일부가 의도적으로 가려지도록 하여, 모델이 RGB 텍스처와 윤곽선만을 바탕으로 거리를 추론하도록 유도합니다.

그 결과, NYUv2 및 ETH3D와 같은 벤치마크에서 최첨단 성능을 달성하며, 심도 정확도는 산업용 심도 카메라를 능가하기도 합니다.

이 모델은 Orbbec의 심도 비전 연구소에서 인증을 받았으며, 양사는 차세대 심도 카메라 개발을 위해 전략적 파트너십을 체결했습니다. 실제 테스트에서 이 모델은 투명 보관 상자를 대상으로 50%의 집기 성공률을 기록했습니다.

LingBot-Depth는 “각 픽셀이 얼마나 멀리 떨어져 있는지 파악”하는 역할을 담당하는 반면, LingBot-Map은 “전체 3D 장면을 실시간으로 이해”하는 역할을 담당합니다.”

이 두 가지가 결합되어 로봇의 공간 지각 과정을 완성합니다.

주방의 유리컵, 실험실의 시험관, 창고의 반사성 금속 용기를 마주한 로봇 팔은 이제 신뢰할 수 있는 3D 공간 좌표 정보를 확보하게 되었습니다.

LingBot-Map, 신체화된 AI의 퍼즐을 완성하다

LingBot-Map, 신체화된 AI의 퍼즐을 완성하다

더 큰 그림에서 볼 때, LingBot-Map의 오픈소스화는 단발성 사건이 아니라, 명확하게 구체화된 AI 로드맵의 중요한 이정표입니다.

지난 1월, 이 팀은 “신체화된 지능 진화 주간(Embodied Intelligence Evolution Week)” 행사 기간 동안 네 가지 모델을 오픈소스로 공개했습니다.”

LingBot-Depth는 깊이 인식을 담당합니다.

LingBot-VLA는 신체화된 대규모 모델로, 상하이 교통대학교의 GM-100 벤치마크에서 실세계 성공률 부문에서 사상 최고 기록을 달성했습니다.

LingBot-World는 Google Genie 3를 대상으로 하며, 16 FPS로 실시간 상호작용을 지원합니다.

LingBot-VA는 영상과 동작에 대한 자기회귀적 공동 모델링을 도입하여, Pi0.5에 비해 실제 과제 성공률을 20% 향상시켰습니다.

하지만 뭔가 빠진 것 같았다.

깊이 추정은 프레임 단위의 “점”을 제공하는 반면, 3D 매핑은 연속적인 “표면”을 제공합니다. 그 중간 단계인 ‘실시간 공간 이해’는 빠져 있었습니다.

LingBot-Map은 바로 그 공백을 정확히 메워줍니다.

이제, 완전히 구현된 AI 스택은 폐쇄 루프를 형성합니다:

세상을 관찰하기 (깊이) → 공간을 이해하기 (지도) → 물리 현상 시뮬레이션하기 (세계) → 결정하고 행동하기 (VLA/VA)

이 체인의 모든 구성 요소는 아파치 2.0 라이선스에 따라 오픈소스로 공개되어 있으며, 코드, 가중치 및 기술 보고서는 Hugging Face 및 ModelScope와 같은 플랫폼을 통해 공개되어 있습니다.

전 세계적으로 볼 때, 이 정도의 개방성은 드문 편이다.

로봇 산업 분야에서, 단일 카메라가 할 수 있는 일의 범위가 방금 더 넓어졌습니다.

참고 문헌

  • LingBot-Map. Hugging Face 저장소 (huggingface.co/robbyant/lingbot-map)
  • LingBot-Map. ModelScope 모델 페이지 (modelscope.cn/models/Robbyant/lingbot-map)
  • LingBot-Map. GitHub 저장소 (github.com/Robbyant/lingbot-map)
  • LingBot-Map: 기하학적 컨텍스트 어텐션을 활용한 스트리밍 3D 재구성. arXiv 프리프린트 (arxiv.org/abs/2604.14141)
  • LingBot-Map 공식 홈페이지 (technology.robbyant.com/lingbot-map)
위로 스크롤