페이페이 리의 월드랩스가 아틀라스를 공개했습니다 — 1440p 1분 영상과 3D를 한 모델로

페이페이 리의 월드랩스가 아틀라스를 공개했습니다 — 1440p 1분 영상과 3D를 한 모델로

챗봇은 글을 읽고 씁니다. 그런데 로봇이 방을 가로지르거나, 영상 속 카메라가 물체 뒤로 돌아 들어가려면 그것만으로는 부족합니다. 공간을 이해해야 하거든요.

2026년 9월 1일, 페이페이 리가 이끄는 월드랩스가 아틀라스를 공개했습니다. 글과 사진, 영상, 3D를 한 모델 안에서 함께 다루는 이른바 옴니 월드 모델입니다. 1440p 화질로 최대 1분짜리 영상을 만들면서 카메라를 원하는 대로 움직일 수 있고, 사진 몇 장만 있으면 그 공간을 3D로 되살립니다.

공간지능이라는 말이 왜 지금 나왔는지, 아틀라스가 실제로 무엇을 할 수 있는지 차근차근 보겠습니다.

칠흑 같은 공간에 청록 선으로만 그려진 커다란 정육면체 뼈대가 떠 있는 이미지 — 공간을 3차원으로 이해하는 월드 모델을 표현

페이페이 리가 다시 움직였습니다

페이페이 리는 이미지넷을 만든 사람입니다. 오늘날 이미지 인식 AI가 가능해진 출발점을 놓은 스탠퍼드 연구자예요.

그가 2024년에 세운 회사가 월드랩스입니다. 창업하자마자 2억 3천만 달러를 모으며 주목받았습니다.

그 회사가 이번에 내놓은 것이 아틀라스입니다. 회사가 지금까지 해 온 작업의 결론에 가까운 모델이에요.

9월 1일, 아틀라스가 나왔습니다

월드랩스는 9월 1일 아틀라스를 공식 발표했습니다. 회사는 이 모델을 옴니 월드 모델이라고 부릅니다.

핵심 주장은 하나입니다. 글, 이미지, 영상, 3D를 따로 다루는 여러 모델을 붙여 쓰는 대신 하나의 모델이 전부 처리한다는 것입니다.

오픈소스는 아니고, 클라우드로 접근하는 상용 모델입니다. 지금은 선별된 파트너에게만 열려 있어요.

칠흑 같은 어둠 속에서 청록 렌즈 하나가 크게 열리는 이미지 — 아틀라스 공개를 표현

월드 모델이라는 말의 뜻

월드 모델은 세상이 어떻게 생겼고 어떻게 움직이는지를 안에 담은 모델을 말합니다.

언어 모델이 다음에 올 단어를 예측한다면, 월드 모델은 다음에 보일 장면을 예측합니다. 카메라를 왼쪽으로 돌리면 무엇이 나타나야 하는지 아는 것이죠.

이게 왜 중요하냐면, 로봇이나 자율주행처럼 실제 공간에서 움직여야 하는 것들이 전부 이 능력을 필요로 하기 때문입니다.

아틀라스가 기존 모델과 갈라지는 지점

기존 영상 생성 모델은 그럴듯한 화면을 만들어 냅니다. 다만 카메라를 돌려 같은 곳으로 되돌아오면 아까와 다른 장면이 나오는 일이 흔했습니다. 기억이 없는 셈이에요.

아틀라스는 입력을 전부 3D 공간에 얹어 놓고 처리합니다. 그래서 지금까지 본 것과 어긋나지 않게 다음을 만들어 냅니다.

화면을 그리는 것과 공간을 기억하는 것은 다른 일입니다. 이 차이가 이번 모델의 출발점입니다.

흐린 청록 빛줄기 네 갈래가 하나의 밝은 빛줄기로 합쳐지는 이미지 — 여러 형식을 하나의 모델로 합친 구조를 표현

하나의 모델이 네 가지 일을 합니다

월드랩스가 밝힌 아틀라스의 주요 작업은 네 가지입니다.

카메라를 조종하는 영상 생성, 사진에서 3D 공간을 복원하는 일, 시간의 흐름까지 시뮬레이션하는 일, 그리고 문장에서 이미지와 파노라마를 만드는 일입니다.

보통은 각각 전용 모델이 따로 있는 영역인데, 이걸 하나가 다 합니다.

첫째 — 카메라를 마음대로 움직이는 영상

가장 눈에 띄는 기능입니다. 장면을 만들면서 카메라 위치와 각도를 원하는 대로 지정할 수 있습니다.

회사는 이것을 픽셀 단위로 정확한 카메라 제어라고 표현합니다. 대충 비슷한 방향이 아니라 지정한 그대로라는 뜻이에요.

영상 제작에서 카메라 워크는 연출의 핵심입니다. 그걸 문장으로 지시할 수 있게 되면 작업 방식 자체가 바뀝니다.

멈춰 있는 어두운 정육면체 둘레를 밝은 청록 고리가 천천히 도는 이미지 — 카메라를 자유롭게 움직이는 제어를 표현

1440p와 1분이라는 한계선

공개된 상한은 명확합니다. 최대 1440p 해상도, 최대 1분 길이입니다.

1440p는 풀HD보다 높고 4K보다는 낮은 해상도입니다. 웹 영상이나 시안 작업에는 충분한 수준이에요.

1분이라는 길이는 짧아 보이지만, 카메라가 자유롭게 움직이면서 공간이 어긋나지 않는 1분이라는 점이 포인트입니다.

둘째 — 사진 몇 장으로 공간을 되살립니다

아틀라스는 실제 장소를 찍은 사진 몇 장을 받아 그 공간을 3D로 복원합니다.

복원된 공간에서는 찍지 않은 각도의 모습도 만들어 낼 수 있습니다. 새로운 시점을 생성한다고 표현합니다.

부동산, 문화재 기록, 사고 현장 재구성처럼 실제 공간을 다시 봐야 하는 일이 많은 분야에 바로 닿는 기능입니다.

작고 흐린 청록 사각 조각 네 개 사이에서 크고 환한 덩어리 하나가 자리를 잡는 이미지 — 사진 몇 장으로 공간을 복원하는 과정을 표현

한 장에서 백 장까지

입력 사진 수는 1장부터 100장 이상까지 가능하다고 밝혔습니다. 폭이 상당히 넓습니다.

한 장만 넣으면 모델이 나머지를 상상해서 채웁니다. 여러 장을 넣을수록 실제에 가까워집니다.

전문 장비 없이 휴대폰 사진 몇 장으로 시작할 수 있다는 점이 실무에서는 꽤 큰 차이를 만듭니다.

포인트 클라우드와 가우시안 스플랫

아틀라스는 복원 결과를 두 가지 형태로 내놓습니다. 포인트 클라우드와 3D 가우시안 스플랫입니다.

포인트 클라우드는 공간을 점의 집합으로 표현한 것이고, 가우시안 스플랫은 최근 3D 분야에서 빠르게 자리 잡은 표현 방식입니다. 부드럽고 사실적인 화면을 실시간으로 보여 줄 수 있어요.

둘 다 다른 3D 도구로 가져갈 수 있는 형식이라, 결과물이 이 모델 안에 갇히지 않습니다.

커다란 어두운 정육면체의 겉면이 작고 고른 청록 점으로 빈틈없이 덮인 이미지 — 포인트 클라우드와 가우시안 스플랫을 표현

셋째 — 시간의 흐름까지 흉내 냅니다

공간만이 아니라 시간도 다룹니다. 물체가 어떻게 움직이고 변하는지를 함께 모델링한다는 뜻입니다.

월드랩스는 이 기능을 영상 특수효과와 로보틱스 쪽 용도로 소개했습니다.

공간과 시간을 같이 다루는 것이 월드 모델의 최종 목표에 가깝기 때문에, 이 항목이 앞으로 가장 중요해질 가능성이 큽니다.

리얼투심, 로봇 학습으로 가는 길

리얼투심은 실제 환경을 시뮬레이션으로 옮기는 작업을 말합니다. 로봇을 진짜로 굴리는 대신 가상 공간에서 먼저 학습시키는 방식이에요.

로봇 학습의 가장 큰 병목이 데이터입니다. 실제 로봇으로 데이터를 모으려면 시간과 비용이 어마어마하게 듭니다.

실제 공간을 사진 몇 장으로 시뮬레이션에 옮길 수 있다면 그 병목이 크게 풀립니다. 월드랩스가 7월에 로보틱스 관련 회사를 인수한 것도 이 맥락으로 읽힙니다.

청록 빛줄기가 길게 휘어지며 지나온 자리를 궤적으로 남기는 이미지 — 시간의 흐름을 따라가는 시뮬레이션을 표현

넷째 — 문장 하나로 360도 파노라마

네 번째 기능은 상대적으로 단순합니다. 문장을 넣으면 이미지와 360도 파노라마를 만들어 줍니다.

파노라마는 VR이나 배경 제작에서 바로 쓰이는 형식입니다.

다른 세 기능에 비해 눈에 덜 띄지만, 앞의 기능들과 이어 쓸 때 진입점 역할을 합니다. 문장으로 공간을 만들고, 그 공간에서 카메라를 움직이는 식이죠.

숫자로 본 성적 — 선호도 75에서 93퍼센트

월드랩스가 공개한 비교 결과입니다. 카메라 제어 영상 생성에서 경쟁 모델들과 일대일로 비교했을 때, 사람이 아틀라스 쪽을 고른 비율이 75에서 93퍼센트였습니다.

경쟁 모델에 따라 폭이 넓지만 어느 쪽과 붙어도 과반을 크게 넘겼다는 뜻입니다.

다만 회사가 직접 낸 수치라는 점은 감안하고 봐야 합니다. 독립 검증은 아직 나오지 않았어요.

크고 환한 청록 사각 판 하나가 훨씬 작고 어두운 판 여러 개를 압도하는 이미지 — 경쟁 모델 대비 선호도 우위를 표현

3D 복원 오차 25.3 대 28.7

3D 복원 쪽은 좀 더 객관적인 지표가 나왔습니다. 평균 오차가 25.3이고, 그다음으로 좋은 전용 모델이 28.7이었습니다.

오차는 낮을수록 좋으니 아틀라스가 앞선 결과입니다.

여기서 의미 있는 부분은 상대가 3D 복원만 하는 전용 모델이었다는 점입니다. 여러 가지를 다 하는 모델이 한 가지만 하는 모델을 이겼다는 이야기예요.

자기회귀 디퓨전 트랜스포머라는 구조

모델 구조는 멀티모달 자기회귀 디퓨전 트랜스포머라고 밝혔습니다. 말이 길지만 뜯어보면 어렵지 않습니다.

자기회귀는 앞을 보고 다음을 하나씩 만들어 내는 방식이고, 디퓨전은 노이즈에서 점점 선명하게 만들어 가는 이미지 생성 방식입니다. 두 방식을 붙였다는 뜻이에요.

파라미터 수는 공개하지 않았습니다. 다만 학습 연산을 늘릴수록 성능이 계속 좋아지는 경향이 뚜렷하다고 강조했습니다.

왼쪽의 흐릿한 번짐에서 시작해 오른쪽으로 갈수록 또렷해지는 청록 곡선 — 노이즈에서 선명해지는 디퓨전 구조를 표현

왜 옴니라는 말을 붙였나

옴니는 전부라는 뜻입니다. 여러 형식을 다 다룬다는 점을 강조하려고 붙인 이름입니다.

업계에서 옴니라는 표현은 오픈AI가 GPT-4o에서 쓰면서 널리 퍼졌습니다. 그때는 글과 음성, 이미지를 뜻했어요.

월드랩스는 여기에 3D와 공간을 넣었습니다. 같은 단어를 쓰되 가리키는 범위를 옮긴 셈입니다.

마블에서 아틀라스까지 열 달

월드랩스의 첫 상용 제품은 마블이었습니다. 2025년 11월에 정식 출시됐어요.

마블은 문장이나 사진에서 편집하고 내려받을 수 있는 3D 공간을 만들어 주는 도구였습니다. 그 뒤 2026년 1월에 개발자용 월드 API가 나왔고, 7월에는 로보틱스 관련 회사를 인수했습니다.

그리고 9월에 아틀라스입니다. 열 달 사이에 도구에서 기반 모델로 무게중심이 옮겨 갔습니다.

크기가 크게 다른 청록 구체 두 개가 하나의 긴 빛줄기로 이어진 이미지 — 마블에서 아틀라스까지의 열 달을 표현

12억 3천만 달러가 모인 회사

자금 규모도 짚어 볼 만합니다. 월드랩스가 지금까지 모은 돈은 총 12억 3천만 달러입니다.

2024년 창업 라운드에서 2억 3천만 달러를 받으며 기업가치 10억 달러를 인정받았고, 2026년 2월에 10억 달러를 추가로 모았습니다.

2년도 안 된 회사에 이 정도가 들어갔다는 것은 공간지능이라는 방향에 대한 기대가 그만큼 크다는 뜻입니다.

오토데스크와 AMD, 엔비디아가 들어온 이유

투자자 명단이 흥미롭습니다. 오토데스크가 2억 달러를 넣었고 AMD와 엔비디아, 피델리티도 참여했습니다.

오토데스크는 건축과 설계 소프트웨어를 만드는 회사입니다. 3D 공간을 다루는 것이 본업이에요.

AMD와 엔비디아는 이 모델이 돌아갈 연산 자원을 파는 쪽입니다. 쓰는 쪽과 파는 쪽이 같이 들어왔다는 점에서 이 기술이 어디에 쓰일지가 어느 정도 드러납니다.

청록 정육면체 세 개가 모서리끼리 맞물려 하나의 단단한 덩어리를 이룬 이미지 — 오토데스크와 AMD, 엔비디아가 함께 들어온 구조를 표현

실제 사례 — 영상 후반 작업이 달라지는 방식

영상 특수효과 작업을 떠올려 보겠습니다. 지금은 실제로 찍은 장면에 3D 요소를 맞춰 넣기 위해 카메라 움직임을 따로 추적하고 공간을 다시 만듭니다. 손이 많이 가는 단계예요.

아틀라스는 촬영 소스에서 공간을 바로 복원하고, 그 공간 안에서 원하는 카메라로 새 장면을 만들어 냅니다.

물론 지금 수준으로 극장용 결과물을 바로 뽑기는 어렵습니다. 다만 시안을 만들고 방향을 정하는 단계는 훨씬 빨라질 수 있습니다.

실제 사례 — 로봇 학습 데이터를 만드는 일

창고에서 물건을 옮기는 로봇을 학습시킨다고 해 보겠습니다. 실제 창고에서 수천 번을 반복시키려면 시간도 비용도 감당하기 어렵습니다.

창고를 사진으로 찍어 3D로 복원하고 그 안에서 시뮬레이션을 돌리면, 같은 학습을 훨씬 싸게 할 수 있습니다.

관건은 시뮬레이션이 실제와 얼마나 가까운가입니다. 여기서 차이가 크면 시뮬레이션에서만 잘하는 로봇이 됩니다. 아틀라스가 복원 정확도를 강조하는 이유가 여기 있어요.

매끄럽고 각진 어두운 덩어리 전체가 가느다란 청록 그물로 감싸인 이미지 — 실제 공간을 시뮬레이션으로 옮기는 작업을 표현

아직 열리지 않은 문, 얼리 액세스

현재 아틀라스는 선별된 파트너를 대상으로 한 얼리 액세스 단계입니다. 신청 양식을 통해 접근을 요청하는 구조예요.

일반 사용자가 지금 당장 써 볼 수 있는 것은 아닙니다. 오픈소스도 아닙니다.

공개된 성능 수치가 대부분 회사 자체 측정이라는 점을 감안하면, 외부에서 만져 볼 수 있게 되기 전까지는 조금 거리를 두고 보는 편이 좋겠습니다.

저시력 사용자에게 공간 AI가 갖는 의미

공간지능은 접근성과 생각보다 가깝습니다. 저시력인 분에게 가장 어려운 일 중 하나가 낯선 공간을 파악하는 것이거든요.

공간을 이해하는 AI는 이 방이 어떻게 생겼고 어디에 무엇이 있는지를 말로 설명해 줄 수 있습니다. 사진 몇 장으로 공간을 복원할 수 있다면, 미리 그 장소를 익히고 갈 수도 있어요.

아틀라스 자체가 접근성 도구는 아닙니다. 다만 공간을 이해하는 기반 기술이 좋아지는 것은, 그 위에 올릴 수 있는 접근성 도구의 천장이 올라간다는 뜻입니다.

넓고 어두운 출입구를 통해 밝은 청록 빛이 앞쪽으로 쏟아져 나오는 이미지 — 공간 AI가 열어 주는 접근성의 가능성을 표현

핵심 정리

첫째, 월드랩스가 9월 1일 아틀라스를 공개했습니다. 글과 이미지, 영상, 3D를 하나의 모델로 다루는 옴니 월드 모델입니다.

둘째, 최대 1440p 해상도로 1분 길이 영상을 만들면서 카메라를 정확히 제어할 수 있습니다.

셋째, 사진 1장에서 100장 이상으로 공간을 3D 복원하고 포인트 클라우드와 가우시안 스플랫으로 내보냅니다.

넷째, 카메라 제어 영상에서 선호도 75에서 93퍼센트, 3D 복원 평균 오차 25.3 대 28.7로 전용 모델을 앞섰습니다. 다만 자체 측정입니다.

다섯째, 월드랩스는 지금까지 12억 3천만 달러를 모았고 오토데스크와 AMD, 엔비디아가 투자자로 들어와 있습니다. 아틀라스는 아직 얼리 액세스입니다.

참고하실 만한 것

지금 당장 쓸 수 있는 것을 찾으신다면 아틀라스보다 월드랩스의 마블 쪽을 보시는 편이 낫습니다. 이미 일반에 열려 있고 무료 등급도 있습니다.

3D나 영상 작업을 하고 계시다면 가우시안 스플랫이라는 형식을 한 번 알아 두시면 좋겠습니다. 앞으로 몇 년 동안 이 형식으로 오가는 결과물이 늘어날 가능성이 큽니다.

SVIL 연구소는 이런 기술이 저시력 사용자에게 어떤 쓸모로 이어질 수 있을지를 계속 살펴보고 있습니다. 의견이나 함께 해보고 싶은 일이 있으시면 아래로 연락 주세요.

출처


협업문의 : kuroicode@gmail.com
블로그 : https://blog.svil.dev/
홈페이지 : https://svil.dev/