Chapter 6: 손과 촉각 — 수작업 자동화의 마지막 병목
개요
제조 수작업에서 가장 어려운 순간은 물체를 보는 순간이 아니라 닿는 순간이다. 핀이 구멍 모서리에 걸리고, 필름이 정전기로 손끝에 붙고, 케이블이 커넥터 안에서 휘고, 고무 패킹이 눌리며, 스크류가 나사산을 잘못 타는 순간에는 시각만으로 실패를 구분하기 어렵다. 그래서 손, 촉각, force, compliance, 양손 협응은 GR00T나 VLA보다 낮은 층에 있지만 실제 자동화 성패를 결정한다.
이 장은 dexterous hand, tactile sensing, human-to-robot demonstration, egocentric human-video pretraining, action representation을 제조 셀의 언어로 정리한다 [3]; [4]; [5]; [14]; [6].
이 장을 읽고 나면... - 왜 수작업 자동화의 병목이 시각 인식보다 접촉 제어에 자주 있는지 설명할 수 있습니다. - 촉각 센서, force sensing, human demonstration이 각각 어떤 데이터를 제공하는지 구분할 수 있습니다. - DexPilot, AnyTeleop, DexUMI, EgoScale 같은 human-to-robot transfer 흐름을 제조 데이터 수집 전략으로 해석할 수 있습니다. - 첫 tactile manufacturing cell에서 측정해야 할 운영 KPI를 정리할 수 있습니다.
6.1 왜 손이 마지막 병목인가
VLA는 목표와 장면을 이해하는 데 강하지만, 손끝이 물체에 닿은 뒤의 미세한 상태를 모두 시각으로 알 수는 없다. 삽입, 정렬, 끼움, 접기, 벗기기, 닦기, rework는 대부분 contact-rich process다. 이때 중요한 정보는 RGB 이미지가 아니라 미끄러짐, 압력 분포, 접촉 위치, 힘의 방향, 부품 변형, 손가락 compliance다.
GR00T 같은 범용 조작 모델도 결국 손과 sensor stack 위에서 작동한다 [1]. 그렇다고 GR00T가 tactile manipulation을 해결했다는 뜻은 아니다. 손이 물체를 안정적으로 잡지 못하면 System 2의 계획은 의미가 없다. 촉각이 없으면 System 1은 "삽입이 진행 중인지", "부품이 걸렸는지", "지금 더 밀면 파손되는지"를 늦게 알거나 아예 알지 못한다.
| 병목 | 시각만으로 어려운 이유 | 필요한 신호 |
|---|---|---|
| 얇은 물체 집기 | 겹침과 단일 sheet 구분이 어렵다 | 손끝 압력, shear, 미끄러짐 |
| 삽입 조립 | 구멍 내부 상태가 보이지 않는다 | force profile, micro motion, 접촉 이벤트 |
| 케이블/필름 | 변형과 마찰이 scene마다 다르다 | compliance, tension, tactile change |
| 재작업 | 실패 원인이 표면 아래에 있을 수 있다 | force, tactile trace, 품질 이미지 |
6.2 촉각 센서와 human grasp data
촉각 센서는 "손끝 카메라"만이 아니다. GelSight와 DIGIT 계열은 elastomer 변형을 시각적으로 읽어 접촉 geometry와 shear 단서를 제공한다. ReSkin 같은 replaceable skin은 비용과 유지보수 문제를 다룬다. force-torque sensor는 손끝보다 거칠지만 삽입과 충돌 감지에 강하다. 어느 센서가 좋은지는 task의 실패 모드가 결정한다.
human grasp data는 또 다른 센서다. DexPilot은 vision-based teleoperation으로 인간 손동작을 로봇 손-팔 시스템에 retargeting하는 흐름을 보여줬고 [4], AnyTeleop은 다양한 arm-hand 조합에 적용 가능한 vision 기반 teleoperation framework를 제시했다 [3]. DexUMI는 인간 손을 universal manipulation interface로 써서 dexterous robot hand demonstration을 모으는 방향을 보여준다 [5].
제조사는 이 흐름을 "멋진 teleop 장치"가 아니라 데이터 수집 전략으로 봐야 한다. 숙련 작업자가 부품을 어떻게 살짝 비틀고, 어느 순간 힘을 빼고, 실패를 감지하면 어디로 되돌아가는지 기록해야 한다. 이 데이터는 VLA fine-tuning보다 먼저 task schema와 failure taxonomy에 연결되어야 한다.
EgoScale은 이 흐름을 teleoperation 장치에서 대규모 egocentric pretraining으로 확장한다. 이 논문은 20,854시간 이상의 action-labeled egocentric human video를 사용해 VLA를 pretrain하고, 22-DoF dexterous hand에서 no-pretraining baseline 대비 평균 성공률 개선을 보고한다 [14]. 제조 수작업으로 번역하면, 숙련자 head-mounted video와 hand motion을 단순 기록물이 아니라 "어떤 접촉 전 행동이 뒤의 성공을 예측하는가"를 학습하는 motor-prior 자산으로 보는 것이다.
다만 EgoScale도 촉각 센서의 대체물이 아니다. egocentric video는 손이 접촉에 들어가기 전후의 순서와 시각 단서를 잘 담지만, 힘의 크기, 미끄러짐, 표면 손상, 삽입 jam 같은 신호는 별도 force/tactile channel과 품질 로그로 보완되어야 한다.
6.3 Reference humanoid와 촉각 손의 의미
NVIDIA의 2026 Isaac GR00T Reference Humanoid 발표가 Sharpa tactile five-finger hands를 포함한 것은 상징적이다 [15]. NVIDIA도 휴머노이드 VLA의 bottleneck을 보기와 언어 이해만으로 보지 않고, 실제 접촉을 감지하고 복구하는 손-센서 스택까지 포함해 reference platform을 정의한 것이다.
하지만 여기서도 선을 그어야 한다. reference humanoid는 tactile manufacturing cell의 검증 결과가 아니라 연구용 integration baseline이다. 공장은 이 발표를 "촉각 손이 포함된 표준 실험체가 생겼다"로 읽어야지, "GR00T가 공장 tactile manipulation을 풀었다"로 읽으면 안 된다.
6.4 Human-to-robot transfer의 한계
사람 손 데이터를 로봇 손으로 옮기는 것은 단순한 좌표 변환이 아니다. 사람 손과 Allegro, Shadow, LEAP, SoftHand, custom gripper는 자유도, 손끝 크기, compliance, 마찰, force limit이 다르다. retargeting은 항상 어떤 정보를 버리고 어떤 정보를 보존할지 결정한다.
따라서 제조 셀에서는 demonstration 수보다 alignment 품질이 중요하다. 사람이 한 행동이 로봇 hand morphology에서 가능한지, fixture와 충돌하지 않는지, tactile event가 같은 의미인지, force limit 안에서 재현되는지 확인해야 한다. 실패한 retargeting은 모델 문제가 아니라 hardware-task mismatch일 수 있다.
FAST 같은 action tokenization 연구는 여기서 의미가 있다 [6]. 손동작은 고주파이고 연속적이며 작은 차이가 결과를 바꾼다. action 표현이 너무 길거나 거칠면 edge latency와 policy smoothness가 함께 무너진다. tactile manipulation에서는 model architecture와 hardware loop rate를 같이 설계해야 한다.
6.5 조립, 검사, 재작업을 위한 tactile stack
제조 tactile stack은 센서 하나가 아니라 계층이다. 첫 층은 end-effector 선택이다. 병렬 그리퍼, compliant gripper, suction, dexterous hand 중 어떤 손이 task를 단순하게 만드는지 먼저 결정한다. 두 번째 층은 sensing이다. wrist force-torque, fingertip tactile, vision, acoustic, motor current가 서로 다른 실패를 잡는다. 세 번째 층은 policy다. diffusion policy, VLA action head, classical impedance control, scripted recovery가 섞일 수 있다.
네 번째 층은 verification이다. tactile signal이 좋더라도 최종 품질은 이미지 검사, 전기 검사, torque check, leak test처럼 공정별 기준으로 확인해야 한다. tactile policy는 품질 판정을 대체하지 않는다. 품질 판정까지 포함해 폐루프가 닫힐 때 생산 자동화가 된다.
6.6 Manufacturing Cell Checkpoint
촉각 셀의 첫 목표는 고난도 dexterity 과시가 아니라 실패를 빨리 알아차리고 안전하게 회복하는 것이다.
| 체크 항목 | 통과 기준 |
|---|---|
| 실패 모드 | slip, jam, over-force, misalignment, surface damage가 분리되어 기록된다 |
| 센서 선택 | 각 실패 모드를 어떤 sensor가 감지하는지 매핑되어 있다 |
| demonstration | human video, teleop trace, robot trial이 같은 task id로 연결된다 |
| human-video pretraining | egocentric video가 product lot, fixture version, quality outcome과 연결된다 |
| 유지보수 | tactile skin 교체, calibration, cleaning 주기가 운영 KPI에 포함된다 |
| 품질 연결 | tactile success가 final inspection, yield, scrap, rework와 연결된다 |
6.7 다음에 배울 것
Part II는 GR00T/VLA, GEAR agent loop, 손과 촉각을 통해 조작 기술의 최전선을 정리했다. 최신 GEAR 흐름을 포함해도 결론은 같다. 대규모 human-video pretraining과 world/action model은 접촉 직전의 판단을 강하게 만들 수 있지만, 생산 책임은 tactile/force/quality loop가 닫혀야 생긴다. 다음 Part III는 이 기술을 공장 배치 문제로 바꾼다.
참고문헌
- Johan Bjorck et al. (2025). GR00T N1: An Open Foundation Model for Generalist Humanoid Robots. arXiv preprint. https://arxiv.org/abs/2503.14734
- Moo Jin Kim et al. (2024). OpenVLA: An Open-Source Vision-Language-Action Model. arXiv preprint. https://arxiv.org/abs/2406.09246
- Yuzhe Qin et al. (2023). AnyTeleop: A General Vision-Based Dexterous Robot Arm-Hand Teleoperation System. Robotics: Science and Systems (RSS) 2023. https://www.roboticsproceedings.org/rss19/p015.pdf
- Ankur Handa et al. (2020). DexPilot: Vision-Based Teleoperation of Dexterous Robotic Hand-Arm System. ICRA 2020. https://doi.org/10.1109/ICRA40945.2020.9197124
- Mengda Xu et al. (2025). DexUMI: Using Human Hand as the Universal Manipulation Interface for Dexterous Manipulation. CoRL 2025 (Best Paper Finalist). https://arxiv.org/abs/2505.21864
- Karl Pertsch et al. (2025). FAST: Efficient Action Tokenization for Vision-Language-Action Models. arXiv preprint. https://arxiv.org/abs/2501.09747
- Yi Li et al. (2025). HAMSTER: Hierarchical Action Models For Open-World Robot Manipulation. arXiv preprint. https://arxiv.org/abs/2502.05485
- Junjie Wen et al. (2024). TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation. arXiv preprint. https://arxiv.org/abs/2409.12514
- Chen Wang et al. (2025). DexCap: Scalable and Portable Mocap Data Collection for Dexterous Manipulation. arXiv / RSS. https://dex-cap.github.io/
- Zilin Si et al. (2025). ExoStart: From 10 Exoskeleton Demos to Dexterous Robot Manipulation. arXiv preprint. https://arxiv.org/abs/2506.11775
- Han Zhang et al. (2025). DOGlove: Dexterous Manipulation with a Low-Cost Open-Source Haptic Force Feedback Glove. RSS 2025. https://arxiv.org/abs/2502.07730
- Open X-Embodiment Collaboration (2024). Open X-Embodiment: Robotic Learning Datasets and RT-X Models. ICRA 2024. https://arxiv.org/abs/2310.08864
- Hao-Shu Fang et al. (2025). DEXOP: Passive Exoskeleton for Direct-contact Dexterous Demonstration. arXiv preprint. https://arxiv.org/abs/2509.04441
- Ruijie Zheng et al. (2026). EgoScale: Scaling Dexterous Manipulation with Diverse Egocentric Human Data. arXiv preprint. https://arxiv.org/abs/2602.16710
- NVIDIA (2026). NVIDIA Announces NVIDIA Isaac GR00T Reference Humanoid Robot for Academic Research. NVIDIA Investor Relations. https://investor.nvidia.com/news/press-release-details/2026/NVIDIA-Announces-NVIDIA-Isaac-GR00T-Reference-Humanoid-Robot-for-Academic-Research/default.aspx