7월, 2026의 게시물 표시

Introducing Gemini Robotics 2

이미지
📝 요약 Google DeepMind가 Gemini Robotics 2를 출시하여 로봇의 지능 및 전신 제어 기능을 향상시켰습니다. 이번 업데이트는 ER(Embodied Reasoning) 모델을 포함한 여러 모델을 선보이며, 복잡한 작업을 수행하고 인간과 유사한 손재주를 갖춘 로봇을 목표로 합니다. Gemini Robotics 2는 로봇의 공간 인식을 강화하고, 다양한 환경에서 작업을 이해하며, 여러 로봇 간의 협업을 지원합니다. 이전 모델들은 강화학습, LLM 통합, 트랜스포머 기술을 활용하여 로봇 제어의 발전을 이끌었습니다. Gemini Robotics 2는 비디오 이해, 안전성, 인간과의 상호작용 등에서 이전 모델보다 크게 개선되었습니다. 새로운 모델들은 AI Studio 및 API를 통해 제공되며, 로봇 개발자들이 접근하여 실질적인 응용 프로그램을 개발할 수 있습니다. Gemini Robotics 2의 궁극적인 목표는 일반적인 목적을 가진 로봇을 구축하여 다양한 작업을 수행하고 인간의 삶을 개선하는 것입니다. 로봇 기술의 발전은 5~10년 내에 일상생활에 더 큰 영향을 미칠 것으로 예상됩니다. 원본 영상: https://www.youtube.com/watch?v=-rYFDefcq3k

Grabette: an open system to record robot-manipulation data

이미지
📝 요약 Grabette는 로봇 학습에 필요한 대규모 조작 데이터셋 구축의 병목 현상을 해결하기 위해 개발된 저비용, 오픈 소스 시스템입니다. 로봇 없이도 휴대용 그리퍼와 카메라를 사용하여 인간의 조작 작업을 녹화하고 이를 로봇 학습에 바로 사용할 수 있는 데이터셋으로 자동 변환할 수 있습니다. 이는 Hugging Face Hub와 같은 개방형 생태계와 통합되어 누구나 쉽게 참여하여 방대하고 다양한 조작 데이터셋을 구축하도록 장려합니다. 몇 분 안에 휴대용 그리퍼로 직접 조작 작업을 녹화하고, 이를 로봇에서 즉시 사용 가능한 데이터셋으로 자동 변환하며, 개방형 협업 로봇 학습 데이터셋 구축에 기여하세요. 병목 현상은 모델이 아닙니다. 데이터입니다. 로봇 학습에는 공급 문제가 있습니다. 우리는 유능한 정책 아키텍처(트랜스포머 기반 VLA, 확산 및 흐름 일치 정책, 심지어 월드 모델까지)와 이를 훈련할 GPU를 보유하고 있습니다. 우리가 부족한 것은 대규모의 다양하고 실제적인 조작 데이터입니다. 이를 수집하기 위해 로봇을 원격 조작하는 것은 비용이 많이 들고 까다로울 수 있습니다. 무엇보다도 로봇이 필요합니다 . 원격 조작 방식에 따라 데이터 수집은 몇 시간이 걸리고 상당한 하드웨어 및 물류 문제를 포함하므로 사용자에게 지루할 수 있습니다. 이는 요구되는 작업 및 환경의 광범위한 다양성과 함께 확장하기 어렵습니다. 하지만 로봇 데이터를 수집하기 위해 로봇이 필요하지 않습니다. 사람의 손, 그리퍼, 카메라, 그리고 손이 수행한 작업의 6-DoF 궤적을 복구할 방법만 있으면 됩니다. 시연을 캡처하면 로봇이 학습할 수 있는 데이터가 됩니다. 오늘 우리가 출시하는 것은 조작 데이터를 녹화하기 위한 개방형 저비용 시스템인 Grabette입니다. 그것을 집어 들고 자신의 손으로 작업을 녹화하면 깨끗하고 로봇에서 즉시 사용 가능한 데이터셋을 얻을 수 있습니다. 로봇도, 실험실도, 원격 조작 장비도 필요 없습니다. 이것이 더 큰 목표입니다. 시연 녹화가 비디오...

LeRobot v0.6.0: Imagine, Evaluate, Improve

이미지
📝 요약 LeRobot v0.6.0은 로봇 학습 루프를 닫는 데 중점을 둔 새로운 릴리스로, 미래를 상상하는 정책, 성공을 감지하는 보상 모델, 실패를 훈련 데이터로 활용하는 배포 CLI, 그리고 벤치마킹을 위한 여섯 개의 새로운 시뮬레이션 환경을 제공합니다. 또한 깊이 감지, VLM 기반 데이터셋 주석, 사용자 지정 비디오 인코딩, 클라우드 훈련, 간소화된 설치 등 다양한 기능이 추가되었습니다. 이번 업데이트는 VLA-JEPA, LingBot-VA, FastWAM과 같은 새로운 정책을 포함하며, GR00T N1.7, MolmoAct2, EO-1, Multitask DiT, EVO1 등 기존 VLA 모델 스토어를 확장했습니다. Robometer와 TOPReward와 같은 보상 모델은 로봇 성공을 평가하기 위한 새로운 인터페이스를 제공하며, 데이터셋 기능은 향상된 비디오 인코딩, 깊이 센서 지원, 언어 주석 기능을 포함합니다. 이번 새로운 릴리스는 로봇 학습 루프를 닫는 것에 관한 것입니다. 즉, 행동하기 전에 미래를 상상하는 정책, 로봇의 성공 여부를 알려주는 보상 모델, 실패를 훈련 데이터로 바꾸는 배포 CLI, 그리고 모든 것을 측정할 수 있는 여섯 개의 새로운 시뮬레이션 벤치마크입니다. 또한 깊이 감지, VLM 기반 데이터셋 주석, 사용자 지정 비디오 인코딩, HF Jobs에서의 클라우드 훈련, 훨씬 더 가벼워진 설치 기능도 제공합니다. 월드 모델: 미래를 상상하는 정책 로보틱스 세계는 큰 질문을 던지고 있습니다. 월드 모델이 로봇 정책에 실제로 도움이 될까요? v0.6.0은 그 질문에 답하는 데 도움이 되도록 LeRobot에 세 가지 정책을 도입합니다. 각 정책은 훈련의 일부로 미래를 상상하는 법을 배우며, 각 정책은 그 상상을 합리적인 비용으로 유지하기 위해 다른 경로를 따릅니다. VLA-JEPA VLA-JEPA는 소형 VLA(Qwen3-VL-2B 기반)에게 행동을 배우는 동안 잠재 공간에서 미래를 예측하도록 가르칩니다. 훈련 중에는 JEPA...