실물 로봇이 없어도 Physical AI를 배울 수 있을까요?
이 책은 로봇을 한 대도 구입하지 않고 PC 또는 Google Colab만으로 Physical AI의 전체 흐름을 직접 경험하는 실습형 입문서입니다.
MuJoCo 시뮬레이션 환경에서 가상의 로봇팔을 움직이는 것부터 시작합니다. 카메라 영상에서 물체를 인식하고, 사람이 직접 보여 준 시연 데이터를 이용해 로봇의 행동 Policy를 학습시킵니다. 마지막에는 VLA(Vision-Language-Action) 모델을 활용해 "빨간 블록을 상자 안에 넣어"와 같은 자연어 명령을 로봇의 행동으로 연결합니다.
이 과정을 통해 독자는 단순히 로봇 관련 기술을 개별적으로 익히는 데 그치지 않고, 관찰(Observation) → 판단(Policy) → 행동(Action)으로 이어지는 Physical AI의 전체 파이프라인을 처음부터 끝까지 이해할 수 있습니다.
이 책을 관통하는 핵심 구조는 매우 단순합니다.
observation → policy → action
처음에는 랜덤하게 행동하는 Agent로 시작하고, 이후 Rule 기반 제어, 학습 기반 ACT, 그리고 자연어와 비전을 함께 사용하는 VLA까지 단계적으로 발전합니다. 로봇 제어와 AI 학습을 한꺼번에 설명하지 않고 순서대로 분리해 다루므로, Physical AI를 처음 접하는 독자도 각 기술이 왜 필요한지 자연스럽게 이해할 수 있습니다.
이 책의 특징
본편인 1부부터 8부까지는 실물 로봇 없이 MuJoCo 시뮬레이션과 공개 데이터셋만으로 모든 과정을 완주할 수 있습니다. 실물 로봇, ROS 2, Isaac Sim 등은 별도의 선택 과정으로 분리하여 처음부터 복잡한 하드웨어 환경을 준비할 필요가 없습니다.
각 장은 설명 → 직접 실행 → 결과 확인 → 조금 더 어려운 실험 → 최종 프로젝트의 흐름으로 구성되어 있습니다. 핵심 장마다 직접 코드를 실행하고 결과를 관찰할 수 있는 실습과 확인 포인트를 제공합니다.
처음부터 AI 모델에 의존하지 않는 것도 이 책의 특징입니다. 먼저 Rule 기반 방식으로 Pick & Place를 완성한 뒤, 동일한 문제를 ACT와 VLA가 어떻게 해결하는지 비교합니다. 이를 통해 로봇 자체의 제어 문제와 AI의 역할을 구분해서 이해할 수 있습니다.
실습에는 MuJoCo, OpenCV, YOLO, Hugging Face LeRobot, ACT, SmolVLA 등 Physical AI 분야에서 널리 사용되는 오픈소스 기술을 활용합니다. 각각의 기술을 단순히 사용하는 데 그치지 않고, 전체 시스템 안에서 어떤 역할을 담당하는지 이해할 수 있도록 구성했습니다.
GPU가 없는 독자도 학습할 수 있도록 CPU, Google Colab, 로컬 NVIDIA GPU의 세 가지 실행 환경을 함께 안내합니다.
AI 활용 집필 및 검증 안내
이 책은 Claude Code(AI)를 활용하여 작성되었습니다.
다만 AI가 생성한 내용을 그대로 사용하는 방식이 아니라, 설치 방법과 실습 코드를 실제 환경에서 직접 실행하여 검증하는 과정을 거쳤습니다. 각 페이지 상단에는 해당 내용의 검증 상태와 사용한 소프트웨어 버전을 표시합니다.
직접 실행하여 결과를 확인한 페이지에는 [검증], 공식 문서와 내용을 대조하여 확인한 페이지에는 [참고] 배지를 표시합니다.
이를 통해 독자는 현재 보고 있는 내용이 실제 실행을 통해 확인된 것인지, 공식 문서를 기반으로 정리된 내용인지 쉽게 구분할 수 있습니다.
대상 독자
Physical AI를 처음 접하거나 아직 익숙하지 않은 독자에게 적합합니다.
기본적인 AI나 Vision 인식 기술에 대한 이해가 있고, Python과 PyTorch를 기초 수준으로 다룰 수 있다면 더욱 수월하게 따라갈 수 있습니다.
특히 로봇 하드웨어와 ROS 경험이 전혀 없는 소프트웨어 개발자, 대학생·대학원생, AI 엔지니어에게 적합합니다.
LLM이나 VLM은 사용해 봤지만 "AI가 물리 세계에서 어떻게 판단하고 행동하는가"를 처음 공부하려는 독자에게도 좋은 출발점이 될 수 있습니다.
이 책을 마치면
이 책을 끝까지 따라가면 MuJoCo에서 로봇을 움직이는 방법뿐 아니라 카메라를 통한 물체 인식, 사람의 시연 데이터 수집, 행동 Policy 학습, ACT 기반 제어, VLA 기반 자연어 명령 수행까지 Physical AI의 전체 구조를 한 번에 경험할 수 있습니다.
무엇보다 개별 라이브러리 사용법을 암기하는 것이 아니라, 로봇이 무엇을 관찰하고, AI가 무엇을 판단하며, 그 판단이 어떻게 행동으로 이어지는지를 이해하는 것이 이 책의 가장 중요한 목표입니다.
예제 코드
이 책의 모든 예제 코드는 다음 GitHub 저장소에서 내려받을 수 있습니다.
https://github.com/ady95/physicalai_tutorial
참고 자료
MuJoCo 공식 문서
https://mujoco.readthedocs.io/
Hugging Face LeRobot
https://huggingface.co/docs/lerobot/index
Ultralytics YOLO
https://docs.ultralytics.com
Gymnasium
https://gymnasium.farama.org