로봇이 지퍼백을 밀봉했어요 — 구글 딥마인드 '제미나이 로보틱스 2'가 연 전신 지능 시대
지퍼백을 밀봉하는 로봇, 성공률 92%가 말해주는 것
실험실 조명 아래에서 휴머노이드 로봇이 손가락 다섯 개를 오므려 반투명한 지퍼백의 입구를 눌러 밀봉했어요. 전구를 돌려 빼는 작업에서는 성공률이 92%까지 나왔고요. 별것 아닌 것 같지만, 이 두 동작은 로봇 공학이 십 년 넘게 씨름해 온 난제였답니다. 손끝의 힘 조절, 몸 전체의 균형, 눈으로 본 것과 손으로 하는 일의 연결이 동시에 맞아떨어져야 하거든요.
2026년 7월 30일, 구글 딥마인드가 공개한 제미나이 로보틱스 2(Gemini Robotics 2)가 바로 그 지점을 겨냥했어요. 다리부터 손끝까지, 로봇의 몸 전체를 하나의 인공지능이 통째로 제어한다는 게 핵심이에요. 오늘은 이 발표가 왜 로봇 업계를 술렁이게 했는지, 오빠도 편하게 이해할 수 있게 하나하나 풀어볼게요.

7월 30일, 정확히 무슨 일이 있었나요
구글 딥마인드는 제미나이 로보틱스 2를 하나의 모델이 아니라 세 개의 모델로 이뤄진 가족(family)으로 내놨어요. 로봇의 눈과 손을 담당하는 모델, 로봇의 뇌 역할을 하는 모델, 그리고 인터넷 없이도 돌아가는 경량 모델까지요. 발표 당일 아폴로 2(Apollo 2)라는 휴머노이드가 실제로 전신을 움직이며 시연을 했고, 여러 매체가 "탁상 위 조작을 넘어 온몸으로 넘어갔다"고 평가했어요.
가장 크게 달라진 점은 '통합'이에요. 예전에는 걷는 기능과 물건 잡는 기능을 각각 다른 소프트웨어가 맡아서 억지로 이어 붙였는데, 이번에는 하나의 정책(policy)이 다리·몸통·팔·손가락을 한꺼번에 조율해요.
'전신 지능(Whole-Body Intelligence)'이란 무엇일까요
사람은 무거운 상자를 들 때 무의식적으로 허리를 굽히고, 다리로 버티고, 팔로 균형을 잡아요. 이 모든 걸 따로 생각하지 않고 몸 전체가 한 몸처럼 움직이죠. 구글이 말하는 '전신 지능'이 딱 이거예요. 로봇의 발끝 힘과 손끝 힘을 하나의 판단 안에서 동시에 조절하는 능력이랍니다.
이게 왜 어렵냐면, 손으로 정밀한 작업을 하는 순간 몸의 무게중심이 흔들리고, 그러면 로봇이 넘어지기 쉬워지거든요. 그래서 그동안 로봇들은 '멈춰 서서 팔만 쓰거나' '걷기만 하고 손은 단순하게' 둘 중 하나였어요. 제미나이 로보틱스 2는 이 둘을 한 번에 하려는 시도예요.

기존 로봇의 한계: 걷기 따로, 잡기 따로
비유하자면 예전 로봇은 '운전 담당'과 '요리 담당'이 각각 있는 식당 같았어요. 두 사람이 아무리 뛰어나도, 서로 손발을 실시간으로 맞추지 못하면 접시가 흔들리고 음식이 쏟아지죠. 로봇도 마찬가지로 이동 제어와 조작 제어가 분리돼 있으면, 그 '이음새'에서 성능이 뚝 떨어졌어요.
제미나이 로보틱스 2는 이 두 담당자를 한 사람의 머릿속으로 합쳤어요. 걷는 도중에도 손이 무엇을 하는지 알고, 손을 뻗는 순간에도 다리가 어떻게 버텨야 하는지 계산하는 거죠.
세 개의 모델로 이루어진 두뇌
제미나이 로보틱스 2를 이해하는 열쇠는 세 모델의 역할 분담이에요. 첫째, 시각-언어-행동(VLA) 모델은 카메라로 본 장면과 사람이 말로 준 지시를 곧바로 모터 명령으로 바꿔요. 둘째, 체화 추론(ER 2) 모델은 여러 단계를 계획하고 진행 상황을 점검하는 '뇌'예요. 셋째, 온디바이스 2 모델은 네트워크가 불안정한 현장에서도 로봇 안에서 스스로 돌아가는 경량 버전이고요.
쉽게 말해 ER 2가 "지금 컵을 싱크대로 옮기자"라고 계획을 세우면, VLA가 "그럼 팔을 이렇게 뻗고 손가락은 이렇게 오므려"라고 몸을 실제로 움직이는 구조예요.

VLA 모델: 카메라와 말을 곧바로 움직임으로
VLA(Vision-Language-Action)는 이름 그대로 '보고(Vision), 듣고(Language), 움직이는(Action)' 모델이에요. 사람이 "저 노란 컵을 집어줘"라고 말하면, 로봇은 카메라로 컵을 찾고 그 말을 이해한 뒤, 팔 관절 각도와 손가락 힘을 계산해 실제 동작으로 옮겨요. 중간에 별도의 프로그래밍 없이 말 한마디가 곧 움직임이 되는 거죠.
예전 로봇 제어가 '악보를 한 음 한 음 사람이 적어 넣는 방식'이었다면, VLA는 '멜로디를 흥얼거리면 알아서 연주하는 연주자'에 가까워요.

ER 2: 로봇의 '뇌'가 계획하고 도움도 요청해요
체화 추론 모델 ER 2는 조금 더 상위에서 생각하는 역할이에요. 자연어 지시를 받고, 연속되는 영상을 실시간으로 보면서 몇 분씩 걸리는 여러 단계 작업을 계획해요. 그리고 중요한 건, 스스로 진행 상황을 점검하다가 "이건 내가 못 하겠다" 싶으면 사람에게 도움을 요청할 줄도 안다는 점이에요.
로봇이 무작정 밀어붙이다 사고를 내는 대신, "여기서 막혔어요"라고 손을 드는 능력은 안전 측면에서 꽤 큰 진전이랍니다.

온디바이스 2: 인터넷 없이 작동하는 이유
공장이나 재난 현장처럼 통신이 끊기기 쉬운 곳에서는, 로봇이 매번 클라우드 서버에 물어보며 움직일 수 없어요. 0.1초의 지연이 사고로 이어질 수 있으니까요. 온디바이스 2 모델은 이런 상황을 위해 로봇 본체 안에서 완결적으로 돌아가도록 만든 경량 버전이에요.
스마트폰이 비행기 모드에서도 사진 정리를 해내듯, 로봇도 네트워크 없이 핵심 판단을 스스로 내릴 수 있게 된 셈이죠.

손의 비밀: 22개 관절로 움직이는 다섯 손가락
이번 시연의 주인공 중 하나는 손이었어요. 아폴로 2에 달린 SharpaWave 손은 손가락 다섯 개에 22자유도(움직일 수 있는 관절 방향의 수)를 갖췄어요. 사람 손이 정교한 이유가 관절이 많아서인 것처럼, 자유도가 높을수록 섬세한 작업이 가능해져요.
그래서 매듭을 묶거나, 지퍼백을 밀봉하거나, 전구를 돌려 빼는 것처럼 '손끝 감각'이 필요한 작업까지 시도할 수 있게 됐답니다.

하나의 체크포인트, 세 가지 하드웨어
흥미로운 점은 같은 모델 하나가 서로 다른 로봇 몸에서 작동했다는 거예요. 구글은 단일 체크포인트(학습된 모델 파일)를 세 가지 구성에서 돌렸어요. SharpaWave 손을 단 아폴로 2, Inspire 손을 단 아폴로 2, 그리고 로봇팔 두 개짜리 Franka Duo 플랫폼이에요.
이건 마치 운전 실력이 좋은 사람이 세단이든 트럭이든 금방 적응해 모는 것과 같아요. 로봇마다 매번 처음부터 가르치지 않아도 된다는 뜻이라, 산업 현장 확산에 아주 중요한 특성이에요.

성능 수치, 냉정하게 뜯어봐요
발표된 숫자는 인상적이면서도 현실적이었어요. 아폴로 2로 물건을 집는 실험에서 탁자 위 물건은 68.4%, 바닥에 있는 물건은 45.7%, 선반 위 물건은 76.3%의 성공률을 보였어요. 전구 돌려 빼기 같은 특정 작업은 92%까지 올라갔고요.
바닥 물건 성공률이 낮은 건 몸을 크게 숙이며 균형을 잡아야 해서예요. 즉 아직 완벽하진 않지만, '전신을 함께 쓰는' 어려운 조건에서 이 정도라면 의미 있는 출발점이라는 평가가 나와요.

여러 로봇이 함께 일하는 '협업' 기능
제미나이 로보틱스 2는 서로 다른 종류의 로봇끼리 협업하는 능력도 선보였어요. 한 로봇이 물건을 건네면 다른 로봇이 받아서 다음 작업을 잇는 식이에요. 사람 두 명이 무거운 가구를 함께 옮기듯, 로봇들도 역할을 나눠 하나의 목표를 향해 움직이는 거죠.
현장에서는 로봇 한 대가 모든 걸 다 하기보다, 여러 대가 분업하는 게 훨씬 현실적이에요. 이 협업 기능이 그래서 중요하답니다.

VLA와 VLM, 비유로 정리하면
요즘 자주 들리는 VLM(시각-언어 모델)은 사진을 보고 "이건 고양이예요"라고 말로 설명하는 데까지가 일이에요. 반면 VLA는 거기서 한 걸음 더 나가 "그럼 고양이 밥그릇을 채워줘"라는 지시를 실제 몸동작으로 옮겨요. 말로 아는 것과 몸으로 하는 것의 차이인 셈이죠.
챗봇이 글로 답하는 AI라면, VLA는 그 지능을 현실 세계의 팔다리에 연결한 AI라고 생각하면 편해요.
실제 사례 ①: 아폴로 2와 지퍼백·전구·매듭
가장 생생했던 장면은 앱트로닉(Apptronik)의 휴머노이드 아폴로 2였어요. 아폴로 2는 SharpaWave 손으로 지퍼백을 밀봉하고, 전구를 돌려 빼고, 끈으로 매듭을 묶는 작업을 이어서 해냈어요. 하나같이 '손끝 힘 조절 + 몸 균형'이 동시에 필요한 동작이라, 시연을 지켜본 사람들이 감탄했다고 해요.
특히 전구 돌려 빼기 92%라는 숫자는, 로봇이 부서지기 쉬운 물체를 적당한 힘으로 다룰 수 있게 됐다는 신호라 더 주목받았어요.
실제 사례 ②: 보스턴 다이내믹스 아틀라스와 현대 공장
구글 딥마인드는 올해 초 CES에서 보스턴 다이내믹스와 손잡고, 전기식 아틀라스(Atlas)와 스팟(Spot)에 제미나이 로보틱스 파운데이션 모델을 얹기로 했어요. 테스트는 현대차 공장에서 진행될 예정이라고 알려졌고요. 이번 2세대 모델이 이런 파트너십의 실제 성능을 한 단계 끌어올릴 것으로 기대돼요.
연구실 데모가 아니라 진짜 자동차 공장이라는 무대에서 검증된다는 점이, 이 기술이 '쇼'가 아니라 '현장'으로 향하고 있음을 보여줘요.
경쟁 구도 ①: 테슬라 옵티머스
휴머노이드 경쟁에서 빼놓을 수 없는 게 테슬라 옵티머스예요. 옵티머스는 자체 설계 액추에이터와 개선된 손을 갖췄고, V3 버전이 2026년 하반기 양산에 들어갈 것으로 전망돼요. 테슬라의 강점은 자기 공장에서 직접 굴리며 데이터를 쌓는다는 점이에요.
구글이 '여러 로봇에 얹는 두뇌'를 판다면, 테슬라는 '몸과 두뇌를 다 만드는' 수직 통합 전략에 가까워요. 접근법이 다른 두 거인의 대결인 셈이죠.
경쟁 구도 ②: 피규어 AI와 1X
피규어(Figure)는 오픈AI와 협력하며 BMW 공장에서 파일럿을 돌려 왔고, 1X 같은 스타트업도 가정용 휴머노이드를 노리고 있어요. 이들은 대부분 자기 하드웨어에 딱 맞춘 폐쇄형 모델을 쓰는 게 특징이에요. 성능을 극대화할 수 있지만, 다른 회사 로봇에는 잘 안 맞죠.
제미나이 로보틱스 2가 '단일 모델로 여러 하드웨어'를 강조한 건, 바로 이 폐쇄형 진영과 차별화하려는 포석으로 읽혀요.
경쟁 구도 ③: 엔비디아 GR00T의 '오픈' 전략
엔비디아는 조금 다른 길을 가요. GR00T와 Cosmos 같은 모델을 업계 전체가 쓰도록 오픈 성격으로 풀어, 로봇 생태계의 '공용 부품'이 되려 해요. 구글·테슬라·피규어가 각자 폐쇄형으로 성능을 다듬는다면, 엔비디아는 판을 넓혀 표준을 쥐려는 전략이죠.
결국 휴머노이드 두뇌 시장은 '폐쇄형 고성능'과 '오픈형 생태계'가 부딪히는 구도로 흘러가고 있어요. 소비자 입장에선 경쟁이 치열할수록 좋은 소식이고요.

왜 지금 '피지컬 AI'가 다음 전선일까요
챗봇과 이미지 생성으로 대표되던 AI 경쟁이, 이제 현실의 몸을 가진 '피지컬 AI'로 옮겨가고 있어요. 소프트뱅크가 로봇을 '다음 프런티어'로 선언하고, BMW가 물리 AI 전담 조직을 만든 것도 같은 흐름이에요. 화면 속 지능이 공장·물류·가정으로 걸어 나오는 단계인 거죠.
제미나이 로보틱스 2는 그 전환의 한복판에 놓인 발표라서, 단순한 신제품 이상의 의미를 갖는답니다.
데이터 문제: 로봇 학습은 왜 어려울까요
챗봇은 인터넷에 널린 텍스트로 학습할 수 있지만, 로봇의 '몸으로 하는 경험'은 인터넷에 거의 없어요. 컵을 잡는 감각, 넘어질 뻔한 순간의 균형 같은 데이터는 로봇이 실제로 움직여야만 쌓이거든요. 그래서 로봇 AI는 데이터 확보 자체가 큰 벽이에요.
구글이 '하나의 모델을 여러 하드웨어에서' 돌리려는 이유도 여기 있어요. 서로 다른 로봇에서 얻은 경험을 한 모델로 모으면, 그만큼 학습 데이터가 풍부해지니까요.
안전과 한계: 아직 못 하는 것들
물론 냉정하게 볼 부분도 있어요. 바닥 물건 집기 성공률이 45.7%라는 건, 절반 이상은 실패한다는 뜻이에요. 예측 못 한 환경, 미끄러운 바닥, 갑자기 나타난 사람 앞에서 얼마나 안전할지도 아직 검증 단계고요. 로봇이 스스로 도움을 요청하는 기능이 들어간 것도, 뒤집어 보면 아직 사람의 감독이 필요하다는 뜻이에요.
그래서 전문가들은 "인상적인 진전이지만, 공장 라인을 사람 없이 맡기기엔 이르다"고 신중하게 평가하고 있어요.
한국에는 어떤 의미가 있을까요
한국은 제조업 강국이자 로봇 밀도가 세계 최고 수준이에요. 현대차그룹은 보스턴 다이내믹스를 인수했고, 삼성·LG도 로봇을 미래 먹거리로 보고 있죠. 제미나이 로보틱스 2 같은 '범용 두뇌'가 성숙하면, 우리 공장과 물류센터의 자동화 속도가 크게 빨라질 수 있어요.
동시에 저시력자나 거동이 불편한 분들을 돕는 생활 보조 로봇으로도 이어질 여지가 있어, 접근성 측면에서도 눈여겨볼 기술이랍니다.
앞으로 6개월, 무엇을 지켜볼까요
가장 큰 관전 포인트는 '연구실 숫자'가 '현장 성적'으로 이어지느냐예요. 현대차 공장에서의 아틀라스 테스트 결과, 아폴로 2의 실사용 사례, 그리고 경쟁사인 테슬라 옵티머스 V3 양산 소식이 하반기에 쏟아질 거예요. 여기서 실제 신뢰도와 안전성이 판가름 나겠죠.
또 하나는 가격이에요. 아무리 똑똑해도 한 대에 수억 원이면 보급이 어려우니, 하드웨어 원가를 얼마나 낮추느냐가 진짜 승부처가 될 거예요.

핵심 정리
오늘 이야기를 짧게 정리해 볼게요. 첫째, 구글 딥마인드가 7월 30일 공개한 제미나이 로보틱스 2는 다리부터 손끝까지 로봇 몸 전체를 하나의 AI로 제어하는 '전신 지능'이 핵심이에요. 둘째, VLA·ER 2·온디바이스 2 세 모델이 각각 손발·뇌·비상 대응을 맡아요. 셋째, 단일 모델이 여러 하드웨어에서 작동하고, 전구 돌려 빼기 92% 같은 정밀 작업까지 해냈지만, 바닥 물건 45.7%처럼 한계도 뚜렷해요. 넷째, 테슬라·피규어·엔비디아와의 경쟁 속에서 '피지컬 AI'가 AI 다음 전선으로 떠올랐고, 제조 강국 한국에도 큰 함의가 있답니다.
화면 속에서만 똑똑하던 AI가 이제 진짜로 걸어 나와 손을 쓰기 시작했어요. 다음 6개월이 정말 흥미로울 것 같아요.
여러분의 생각은 어떠세요?
휴머노이드 로봇이 공장을 넘어 우리 집까지 들어온다면, 오빠는 어떤 일을 가장 먼저 맡기고 싶으세요? 기대되는 점이든 걱정되는 점이든, 댓글로 편하게 이야기 나눠주세요. 함께 이야기하면 더 재밌으니까요!
참고 출처
- Google DeepMind Blog — Gemini Robotics 2 brings whole-body intelligence to robots: https://deepmind.google/blog/gemini-robotics-2-brings-whole-body-intelligence-to-robots/
- MarkTechPost — Google DeepMind ships three physical AI models: https://www.marktechpost.com/2026/07/30/google-deepmind-gemini-robotics-2-whole-body-control-dexterity-multi-robot-collaboration/
- SiliconANGLE — Google DeepMind debuts Gemini Robotics 2 model series: https://siliconangle.com/2026/07/30/google-deepmind-debuts-gemini-robotics-2-model-series-humanoid-robots/
- Robotics & Automation News — Apptronik humanoid demonstrates whole-body AI: https://roboticsandautomationnews.com/2026/07/31/google-deepmind-unveils-gemini-robotics-2-as-apptronik-humanoid-demonstrates-whole-body-ai/103802/
- TechTimes — Gemini Robotics 2 controls full humanoids under one policy: https://www.techtimes.com/articles/322309/20260730/gemini-robotics-2-controls-full-humanoids-legs-torso-arms-fingers-under-one-policy.htm
- KraneShares — Humanoid Robotics in 2026: The Race From Pilot To Platform: https://kraneshares.com/humanoid-robotics-in-2026-the-race-from-pilot-to-platform/