Journal of Korea Robotics Society
[ ARTICLE ]
The Journal of Korea Robotics Society - Vol. 21, No. 2, pp.164-171
ISSN: 1975-6291 (Print) 2287-3961 (Online)
Print publication date 29 May 2026
Received 29 Dec 2024 Revised 01 Apr 2025 Accepted 11 Jan 2026
DOI: https://doi.org/10.7746/jkros.2026.21.2.164

양방향 모션 플래닝 특성을 활용한 학습 기반 샘플링 전략

전수현1 ; 김민수1 ; 장준원2 ; 장민수2 ; 박재흥
Learning-Based Sampling Strategies Leveraging Bidirectional Motion Planning Characteristics
Suhyun Jeon1 ; Minsoo Kim1 ; Junwon Jang2 ; Minsu Chang2 ; Jaeheung Park
1Student, Graduate School of Convergence Science and Technology, Seoul National University, Seoul, Korea suhyun0606@snu.ac.krmsk930512@snu.ac.kr
2Researcher, Samsung Advanced Institute of Technology, Samsung Electronics Co. Ltd., Suwon, Korea jw526.jang@samsung.comminsu.chang@samsung.com

Correspondence to: Professor, Corresponding author: Graduate School of Convergence Science and Technology, Automation and Systems Research Institute, Artificial Intelligence Institute, Seoul National University, Seoul, Korea and Advanced Institutes of Convergence Technology, Suwon, Korea ( park73@snu.ac.kr)

CopyrightⓒKROS

Abstract

This study proposes a stepwise sampling strategy for manipulator motion planning that enhances learned sampling distributions for bidirectional sampling based algorithms, such as RRT-Connect. Existing approaches using learned distributions often fail to account for the nature of bidirectional search, such as adapting sampling to the order of bi-directional tree growth or effectively sampling unexplored regions between the start and goal trees. These limitations hinder their efficiency in finding a shorter path. The proposed algorithm introduces two key sampling strategies: swing sampling, which alternates sample extraction between the trees during their respective growth phases, and bounded sampling, which focuses on generating samples between the trees to expedite the discovery of a complete path. Additionally, Gaussian noise is applied to the learned samples to mitigate inaccuracies in the learned distributions, ensuring robustness for the planner. The experiment was conducted in a simulation involving the task of moving a cup on a 4-tier shelf. The proposed algorithm improves over existing neural sampling methods by achieving a 43.69% faster planning time, a 4.64% shorter path and a 2% higher success rate.

Keywords:

Motion Planning, Robot Learning, Manipulator

1. 서 론

매니퓰레이터 로봇의 모션 플래닝은 제조, 물류, 의료 등 다양한 분야에서 필수적인 요소로 자리 잡고 있다[1]. 모션 플래닝은 주어진 환경 내에서 로봇이 충돌 없이 시작지점에서 도착 지점까지 이동할 수 있는 경로를 생성하는 방법을 말한다. 이를 위해 다양한 알고리즘이 개발되었으며, 매니퓰레이터의 모션 플래닝에서 대표적으로 쓰이는 방법은 샘플링 기반 모션 플래닝이다. 이는 높은 차원의 복잡한 공간에서도 효율적으로 경로를 탐색할 수 있는 방법으로 널리 사용되고 있다[2-4].

샘플링 기반 모션 플래닝 알고리즘의 구조는 다음과 같다. 로봇의 상태공간에서 무작위 점들을 샘플링한 다음 자가충돌, 주변환경과의 충돌 등 다양한 제약조건을 만족하는지 검사한다. 그 뒤에 제약조건을 만족하는 점들을 잇는 방식으로 시작 지점에서 도착 지점까지 경로를 획득한다. 이러한 알고리즘에는 RRT (Rapidly-exploring Random Tree)[5] 및 PRM (Probabilistic Roadmap)[6]과 같은 기법이 있으며, 다양한 연구에서 그 방법의 효율성과 실용성을 입증해왔다. 그러나 기존의 샘플링 기반 방법들은 주로 무작위 샘플링에 의존하기 때문에, 불필요하게 많은 샘플을 생성하여 작업 수행시간이 증가하게 된다. 또한 다자유도 매니퓰레이터 시스템이나 복잡한 환경에서의 모션 플래닝은 많은 계산량을 필요로 하게 된다.

기존의 샘플링 기반 방법의 문제점을 개선하기 위해 학습된 분포를 활용한 샘플링 방법이 제안되었다[7-10]. 샘플링 분포 학습 방법은 샘플링 효율성을 향상시키기 위한 시도로 제안되었지만, 이들 대부분은 양방향 탐색 알고리즘의 특성을 충분히 반영하지 못하는 한계가 있다[7,11,12]. RRT-connect와 같은 양방향 탐색 알고리즘은 기존 RRT와 달리 양방향 탐색을 사용하여 시작점과 목표점에서 번갈아 가면서 트리를 확장하고, 두 트리가 만날 때까지 탐색을 진행한 후 경로를 연결한다[13]. 이 방식은 목표에 빠르게 수렴할 수 있어 경로 탐색 효율이 높고, 계산 비용이 적어 복잡한 환경에서도 더 빠르고 효율적인 경로를 찾을 수 있다. 기존 알고리즘은 두 트리의 성장 순서에 따른 샘플링을 고려하지 못하며 또한 시작 트리와 목표 트리 사이의 탐색되지 않은 영역을 집중적으로 샘플링 하지 않는다. 이러한 한계는 더 짧은 경로를 찾는데 있어 샘플링 효율성을 낮추는 주요 요인으로 작용한다.

본 연구에서는 샘플링 분포 학습 기반 모션 플래닝 방법의 효율성을 개선하기 위해 양방향 탐색 알고리즘의 특성을 반영한 샘플링 전략을 제안한다. 신경망 모델은 주어진 모션 플래닝 문제와 주변 환경 정보를 통해 경로가 생길 가능성이 높은 영역을 샘플링 분포의 형태로 예측한다. 학습된 샘플링 분포는 경로의 순차적인 정보를 담고 있는 스텝 변수를 사용해 양방향 탐색 성질을 고려할 수 있는 step-wise 샘플링 전략에 사용된다. Swing 샘플링은 시작 트리/목표 트리의 자라는 순서를 고려하며 순차적으로 샘플링이 진행된다. Bounded 샘플링은 탐색되지 않은 구간을 계산한 뒤, 스텝 변수를 활용해 우선적으로 탐색할 구간을 설정하여 효율적으로 경로를 확장한다. 스텝 전략과 더불어 샘플링 분포에 Gaussian 노이즈를 추가하는 방법을 통해 모션 플래닝의 성공률을 높인다. 학습한 모델이 스텝에 따른 순차적인 경로를 학습했는지 t-SNE 시각화를 통해 확인한다. 시뮬레이션 상에서 모션 플래닝 실험을 통해 제안한 방법의 성능을 확인한다.

본 연구의 주요 기여는 다음과 같다.

  • • 스텝 조건 정보를 활용한 샘플링 전략을 제안한다. 기존 방법들은 샘플링 시에 양방향 탐색 알고리즘의 성질을 반영하지 않는다. 스텝 변수는 경로에 대한 순차적인 정보를 갖고 있기 때문에 스텝 변수를 활용하면 양방향 탐색 알고리즘에 맞는 적절한 샘플링 전략을 사용할 수 있다. Swing 스텝과 Bounded 스텝이라는 두 가지 스텝 변수를 활용한 샘플링 전략을 통해, 양방향 탐색 알고리즘의 성능을 향상시켰다. 모션 플래닝 실 험 결과, 경로를 구하는 시간을 단축시켰으며 경로 길이 또한 감소하였다.
  • • 생성한 샘플링 분포에 노이즈를 추가하는 방법을 제안한다. 기존 방법들은 모션플래닝의 성능을 위해 무작위 추출과 학습된 샘플링 분포를 단순히 혼합하여 사용한다. 본 연구에서는 잠재공간 복원 과정에서 샘플링 후에 추가적인 Gaussian 노이즈를 더하는 방식을 도입하여 모션 플래닝의 성공률을 높인다. Gaussian 노이즈를 사용하는 방법은 복잡한 환경에서도 알고리즘의 강건성을 유지하며 간단한 방법으로 모션 플래닝의 성공률을 높이고 더 짧은 경로를 탐색하는 데 기여한다.

본 논문은 총 5장으로 구성되어 있으며 순서는 다음과 같다. 2장에서는 선행 연구와 모션 플래닝 문제가 소개된다. 3장에서는 제안된 신경망 기반 샘플링 분포 학습 모델의 구조 및 학습 방법과 스텝을 통한 샘플링 전략과 Gaussian 노이즈를 추가하는 방법을 설명한다. 4장에서는 실험 및 실험 결과를 제시하고, 마지막으로 5장에서 본 연구의 결론 및 한계를 논의한다.


2. 선행 연구 및 배경

2.1 선행 연구

Ichter 등은 샘플링 기반 모션 플래닝을 위한 샘플링 분포 학습 방법을 처음으로 제안하였다[3,7]. 이 논문에서는 uniform sampling 과 non-uniform sampling 방식을 적절한 비율로 섞어서 샘플링할 때 사용하는 방법을 소개하였다. non-uniform sampling은 주어진 데이터에서 학습된 샘플링 분포를 바탕으로 편향 샘플링(bias sampling)을 진행한다. 학습에 사용된 모델은 CVAE (Conditional Variational Autoencoder) 신경망 모델이며 샘플링 분포를 더 낮은 차원인 잠재공간에 학습하게 된다[14]. 모션 플래닝 과정에서는 학습된 잠재 공간에서 무작위로 샘플을 추출한다. 그러나 이러한 방법은 모션 플래닝 알고리즘의 진행 상황을 충분히 고려하지 못한다. 트리의 생성 위치나 경로 형성 가능성을 반영하지 않기 때문에 샘플링 효율성이 저하될 수 있다. 예를 들어, 목표 지점에 거의 도달한 상황에서 시작 지점 근처에 샘플링되면 모션 플래닝이 지연되고, 새로운 점을 다시 생성해야 하는 비효율이 발생할 수 있다. 본 논문에서는 이러한 점을 개선하고자 샘플링 분포 학습시에 경로의 위치에 대한 정보인 스텝을 추가하여서 더 효율적인 모션 플래닝을 진행한다.

Wang 등은 CNN (Convolutional Neural Network) 모델을 사용해서 2차원 환경에서 샘플링 분포 학습을 통해 모션 플래닝 하는 방법을 제안하였다[11]. 이 논문에서는 장애물 정보와 환경을 이미지 형태로 입력 받아 편향 샘플링을 수행하고, 이를 RRT* 알고리즘에 결합한 NRRT* 기법을 제안한다. 제안한 방법은 2차원 환경에서 모바일 로봇 주행을 위해 모션 플래닝을 진행하였으며 A*알고리즘을 통해 경로 데이터를 획득하였다. 이 논문에서 제안한 방법은 관절 공간에서 동작하는 매니퓰레이터에 대해서는 고려를 하지 않았다. 다른 선행연구에서는 narrow passage의 위치같이 특정 영역에 대한 정보를 바탕으로 주변 환경에 대한 정보를 학습하였다[7]. 이러한 방법은 특정 문제 상황에서는 적용할 수 있지만 일반적인 환경에서는 적용하기 힘들다는 문제점이 있다. 매니퓰레이터와 같이 고차원 로봇과 로봇 주변의 3차원의 주변 환경을 고려할 수 있는 방법이 필요하다. 본 논문에서는 이러한 점을 개선하고자 3차원의 주변 환경 정보를 voxel로 입력 받아 신경망 모델에 정보를 전달하고 이를 통해 3차원의 주변 환경을 고려하여 샘플링 분포를 학습하는 방법을 제안한다.

2.2 모션 플래닝

모션 플래닝 문제는 다음과 같이 수학적으로 정의된다. 로봇의 상태공간은 Q ⊂ ℝn로 자유도가 n인 로봇의 모든 가능한 상태를 나타낸다. 이 중에서 주위 환경 혹은 물체와 충돌이 없는 자유공간은 QfreeQ, 충돌이 있는 공간은 Qobs = QQfree이다. 모션 플래닝의 목표는 로봇의 상태공간에 대해 단사함수 σ:[0,1]→Qfree를 찾는 것이다. 이때 σσ(0) = qstart, σ(1) = qgoal이라는 경계조건을 만족해야 한다. 모션 플래닝 문제에 따라 σ(1) ∈ Qgoal과 같이 목표점이 아닌 목표영역을 사용할 수 있다. 목표영역이 작업공간에서의 자세인 경우, 로봇의 기구학 정보를 통해 목표영역 만족 여부를 계산할 수 있다[15].

학습 기반의 모션 계획은, 최적 경로를 신경망으로 샘플링 분포 형태로 예측한 후, 이를 경로 계획 과정에서 샘플링 함수로 사용한다. 최적화된 경로를 구할 확률이 높은 영역에 편향된 분포로 샘플링을 하게 되면 이러한 해를 구하는 시간을 단축시킬 수 있다. [Fig. 1]처럼 uniform sampling 분포와 bias sampling 분포 선택 비율인 편향 비율에 따라 샘플링 된 점들이 달라진다. 편향 비율은 bias sampling을 얼마나 많이 사용할지에 대한 비율이며, 편향 비율이 r이면 bias sampling을 r만큼 사용하고 uniform sampling은 (1-r)만큼 사용한다.

[Fig. 1]

Differences in sampling methods based on sampling distribution selection ratios, yellow means uniform sampling, green means bias sampling, bias ratio (Left: 0, Middle: 0.5, Right: 1)


3. 방 법

제안하는 방법은 로봇의 모션 플래닝 데이터를 CVAE 모델로 학습한 뒤에 학습된 CVAE 모델을 모션 플래닝의 샘플링 시에 사용하는 방법이다. 이때 조건 변수로 기존 연구와는 다르게 스텝 변수를 학습시켜 스텝을 활용한 샘플링 전략을 통해 모션 플래닝의 성능을 개선시켰다. 그러기 위한 샘플링 분포 학습 방법 그리고 스텝을 사용한 샘플링 전략 그리고 Gaussian 노이즈를 추가하는 방법을 소개한다.

3.1 샘플링 분포 학습 방법

VAE (Variational Autoencoder) 모델[16]의 학습 목표는 인코더를 통해 학습 데이터를 차원이 낮은 잠재공간으로 변환시킨 다음 디코더를 통해 잠재공간에서 원래의 데이터로 다시 복원하는 것이다. CVAE 모델은 VAE에 condition이라는 조건 정보가 추가된 생성형 학습 모델이다. CVAE 모델은 입력데이터를 모델에 입력시킬 때와 복원시킬 때 조건 정보를 같이 전달해 원래 데이터를 잘 복원할 수 있다는 특징을 가진다. 학습된 CVAE 모델은 다양한 데이터를 생성하기 위해 사용된다. 데이터 생성 시에는 디코더 부분만을 분리해서 사용하며 잠재공간에서 추출된 분포를 디코더 모델에 통과시켜서 데이터를 생성하게 된다.

획득한 모션 플래닝 데이터를 통해 CVAE 모델을 기반으로 로봇 경로 생성을 수행하는 모델을 [Fig. 2]처럼 구성하였다. CVAE는 데이터 X와 조건 C가 주어졌을 때, 관절 각도 X의 생성 분포 p(X|C)를 학습한다. 학습 과정에서 Encoder는 입력 데이터 X를 조건 C와 함께 잠재 변수 Z의 분포 qϕ(Z|X,C)로 매핑하며, Decoder는 Z와 C를 기반으로 pθ(X|Z,C)를 통해 X^를 재구성한다. 학습은 변분 추론(Variational Inference)을 활용하여, 잠재 변수 Z에 대한 조건부 변분 하한식(Evidence Lower Bound, ELBO)을 최대화하는 방식으로 이루어진다.

L(ϕ,θ)=Eqϕ(ZX,C)[logpθ(XZ,C)]-DKL(qϕ(ZX,C)pθ(Z))(1) 
[Fig. 2]

Neural network model for learning sampling distribution, (Left) training model, (Right) inference model

여기서 pθ(Z)는 잠재 변수 Z의 사전 분포(prior distribution)로 일반적으로 표준 정규분포 N(0, I)를 사용하며, KL-Divergence를 사용하여 Encoder가 잠재 공간에서 학습된 분포 qϕ(Z|X,C)와 사전 분포 p(Z)가 서로 유사해지게 만든다.

모델에서 조건 C는 로봇의 경로 계획에 필요한 3가지 요소로 구성된다. 첫째, 로봇 상태공간에서의 시작점과 목표점 정보, 즉 두 개의 관절값에 해당하는 정보와, 둘째, 로봇 주변 환경을 3차원 점유 격자 지도(Occupancy Grid Map)로 표현하고 이를 Grid-Encoder를 통해 차원을 압축해서 사용한다. 셋째, 로봇 경로의 순서 정보를 포함하여 경로 진행 상태(시작: step=0, 목표: step=1)를 반영한다.

3.2 스텝을 사용한 샘플링 전략

로봇의 모션 플래닝을 효율적으로 수행하기 위해 경로의 순차적인 정보를 학습한 스텝 변수를 활용한 새로운 샘플링 전략을 제안한다. 학습된 모델에서 랜덤 샘플을 추출하여 관절 각도를 생성하며, 이 과정은 배치 단위로 병렬 처리되어 다수의 샘플을 동시에 생성한다. 이때 모션 플래닝에 의해 조건 변수가 설정되며, 스텝 조건 변수는 샘플링 전략에 따라 0과 1사이에서 적절히 선택된다. 이렇게 생성된 샘플은 uniform 샘플링 분포와 학습된 샘플링 분포를 혼합하여 BiRRT* 알고리즘에 사용된다.

경로 생성의 효율성을 높이기 위해 다양한 스텝기반 샘플링 전략을 도입하였다. 스텝 변수는 주어진 경로를 시작 지점을 0, 도착 지점을 1로 설정한 뒤 이 사이 구간을 이산화한 값이다. Swing 샘플링은 BiRRT 알고리즘에서 시작 트리와 목표 트리에서 번갈아 가며 노드를 생성한다는 특성을 반영한 방법이다. 기존 스텝 변수의 범위는 0에서 1 사이의 값으로 정해서 디코더에 넣게 되지만 Swing 샘플링은 두 구간으로 나누어 트리의 종류에 따라 해당 구간에서 샘플링을 하게 된다. [Fig. 3]의 위 그림처럼 시작 트리에서 노드를 연장할 때에는 스텝 변수의 범위를 [0, 0.5] 구간 안에서, 목표 트리에서 노드를 연장할 때에는 스텝 변수의 범위를 [0.5, 1] 구간 안에서 정해 놓고 샘플링을 수행한다. Bounded 샘플링은 [Fig. 3]의 아래 그림처럼 트리간의 거리, 시작 트리의 거리 그리고 목표 트리의 거리 정보를 활용하여 스텝 변수 구간의 하한(lower bound)과 상한(upper bound) 사이에서 샘플링을 진행한다. 다음식을 통해 하한과 상한에 대한 값을 계산할 수 있다. T는 트리 뜻하며, d(·)는 거리 함수이다. d(Tstart, Tgoal)는 시작 트리와 목표 트리 사이의 거리이며, d(Tstart)는 시작 지점에서부터 목표 트리로 뻗어나간 시작 트리의 거리를 뜻한다. d(Tgoal)는 목표 지점에서부터 시작 트리로 뻗어나간 목표 트리의 거리를 뜻한다.

 lower bound =d(Tstart )d(Tstart )+d(Tstart ,Tgoal )+d(Tgoal )(2) 
 upper bound =d(Tstart )+d(Tstart ,Tgoal )d(Tstart )+d(Tstart ,Tgoal )+d(Tgoal )(3) 
[Fig. 3]

A step-based sampling strategy, Swing (Top) and Bounded (Bottom) steps, where the step variable discretizes the path between the start (0) and goal (1) points. Grey objects are obstacles. Swing sampling: Reflects the alternating node generation characteristic of the BiRRT algorithm by sampling step within [0, 0.5] for the Start Tree (orange area) and sampling step within [0.5, 1] for the Goal Tree (blue area). Bounded Sampling: Utilizes the distance between trees and sample within a calculated lower and upper bound (green area), with approximated bounds determined by specific formulas during the BiRRT process

이러한 샘플링 전략은 학습된 분포의 활용과 다양한 탐색 방식을 결합함으로써 모션 플래닝의 효율성과 품질을 크게 향상시킨다.

3.3 샘플링 분포에 Gaussian 노이즈 추가 방법

본 연구에서는 무작위 추출과 학습된 샘플링 분포에 Gaussian 노이즈를 추가한 분포를 섞어서 사용한다. 기존의 방법들은 모션 플래닝 성능 향상을 위해 무작위 추출과 학습된 샘플링 분포를 단순히 혼합하여 사용했지만, 이러한 방법은 학습된 분포의 부정확성으로 인해 경로 예측에 한계가 있다. 이에 반해, 잠재 공간 복원 과정에서 샘플링이 이루어진 후 Gaussian 노이즈를 추가하는 방법은 샘플링의 다양성을 확보하고, 생성된 관절 값들이 특정 환경에 편향되어 있는 문제를 완화한다. 이러한 방법은 학습한 모델의 일반화 성능을 높여줄 수 있다.


4. 실험 및 실험 결과

CVAE 모델 학습을 위해 사용한 데이터와 데이터 생성 방법을 소개한다. 생성한 데이터를 통해 CVAE 모델이 스텝에 따른 순차적인 경로를 잘 학습했는지 확인하기 위해 저차원 시작화를 사용하였다. 제안한 샘플링 전략의 모션 플래닝 성능을 검증하기 위해, 책장과 3개의 직육면체 장애물이 있는 환경에서 매니퓰레이터의 pick-and-place 모션 플래닝 실험을 진행한다. 또한 학습한 모델의 일반화 성능을 평가하기 위해 환경을 3단계로 나누어서 성능을 측정하였으며 실험은 시뮬레이션 환경에서 진행하였다.

4.1 데이터 생성 방법

BiRRT* 알고리즘[2]을 사용하여 총 500개의 서로 다른 환경에 대해서 제한 시간 500sec로 준최적 경로(near-optimal path) 데이터를 획득하였다. 데이터 생성은 시뮬레이션 환경에서 진행되었으며 ROS 및 MoveIt! 을 사용하였다. BiRRT* 플래너는 MoveIt! 에서 제공하는 기본 플래너를 사용하였다. [Fig. 4]는 데이터 생성에 사용된 환경을 RViz로 시각화한 결과이다. 시뮬레이션에서 7자유도의 매니퓰레이터를 통해 다양한 시작 자세와 도착 자세에서 책장의 한 층에서 다른 층으로 컵을 옮기는 작업의 데이터를 생성하였다. 환경에는 책장 말고도 3개의 직육면체의 장애물의 크기와 위치를 랜덤하게 배치하였다.

[Fig. 4]

Data generation scenario with a 7-DOF manipulator moving a cup between shelves in a bookshelf, with three randomly placed cuboid obstacles in RViz

4.2 스텝에 따른 샘플링 분포

본 연구에서 CVAE 학습 모델의 성능을 평가하기 위해, 학습 결과에 대한 분석 실험을 우선 진행하였다. CVAE 모델을 활용하여 로봇 모션 플래닝을 학습한 데이터를 저차원 공간에서 시각화하기 위해 t-분포 확률적 임베딩을 사용하였다.

시각화 결과는 학습한 로봇 경로 데이터의 스텝에 따른 분포를 보여준다. [Fig. 5]에서 볼 수 있듯이 학습된 경로 중 일부는 목표 지점으로 매끄럽게 연결된 좋은 경로를 나타내며, 이는 CVAE가 적절한 분포를 학습했음을 나타낸다. 그러나 중간에 경로가 단절된 끊긴 경로와 복잡하게 꼬여 있는 경로도 관찰되었다. 이러한 결과는 CVAE가 높은 차원의 복잡한 데이터 분포를 학습하는 과정에서 데이터의 불균형 또는 특정 조건에서의 일반화 한계를 드러낼 가능성을 보여준다. 특히, 경로가 단절되거나 꼬이는 현상은 데이터의 부족 또는 주변환경의 장애물 정보 혹은 상태공간에 대한 학습이 충분하지 않을 수 있음을 암시한다. 다양한 환경에 대한 정밀한 샘플링 분포를 학습하기 위해서는 더 연구가 필요함을 뜻한다. 제안한 방법은 이와 같은 문제를 어느 정도 완화하기 위해, Gaussian 노이즈를 추가하는 방법을 사용한다.

[Fig. 5]

t-SNE visualization of neural sample paths generated by the CVAE model, where the color transitions from yellow to purple as the step variable changes from 0 to 1

4.3 실험 환경 및 설정

본 연구에서는 학습한 모델의 일반화 성능을 평가하고, 장애물 및 시작자세와 도착자세에 따른 성능을 확인하기 위해 실험을 세 가지 단계로 나누어 진행하였다. 단계가 높아질수록 더욱 높은 일반화 성능을 필요로 한다. 첫 번째 단계는 학습 환경과 동일한 환경에서 실험을 진행하였고, 두 번째 단계는 시작자세와 도착자세만 변경된 환경에서 실험을 진행하였다. 마지막으로 세 번째 단계에서는 장애물과 시작자세 및 도착자세가 모두 변경된 환경에서 실험을 진행하였다. 장애물과 책장의 위치에 따라 상태공간의 구조가 바뀌게 되고 시작자세와 도착자세에 따라 상태공간에서의 출발 지점과 도착지점이 바뀌게 된다.

제안된 샘플링 전략의 성능을 비교하기 위해 모션 플래닝 알고리즘으로는 BiRRT* 알고리즘을 1초 동안 실행하며 총 6가지 샘플링 전략에 대해 실험을 수행하였다. 샘플링을 수행하는 부분은 제안한 방법을 직접 구현하여 사용하였고 이에 맞게 MoveIt의 BiRRT* 플래너를 수정하여 사용하였다. 실험 대상은 (1) Uniform Sampling (US): 전통적인 uniform 샘플링 기반 모션 플래닝, (2) Learned Sampling (LS): 학습된 샘플링 분포를 활용한 신경망 기반 모션 플래닝, (3) Learned Sampling with Gaussian noise (LSG): 학습된 샘플링 분포에 Gaussian 노이즈를 추가한 방법, (4) Learned Sampling with Gaussian noise and Swing step (LSG-S): LSG 방법에 Swing 스텝 전략을 적용한 방법, (5) Learned Sampling with Gaussian noise and Bounded step (LSG-B): LSG 방법에 Bounded 스텝 전략을 적용한 방법 그리고 (6) Learned Sampling with Gaussian noise and Bounded Swing step (LSG-BS): LSG 방법에 Bounded 와 Swing 스텝 전략을 동시에 적용한 방법으로 구성되었다.

성능 평가를 위한 값은 총 3 가지로 생성된 경로 관절공간에서의 길이인 path length, 모션 플래닝 성공 여부에 대한 값인 success rate 그리고 최초의 경로를 구하기까지 걸린 시간인 planning time이다.

3개의 단계에 대해 각각 6가지 서로 다른 샘플링 전략을 진행하고 결과를 비교하였고 각각의 샘플링 전략마다 100개의 환경에 대한 실험을 진행하였다. 실험에 사용한 bias ratio는 0.5로 대부분의 선행연구에서 사용하고 있는 값을 사용하였다[7].

4.4 실험 결과

각각의 단계별로 결과를 분석하였을 때, [Table 1]에서 확인할 수 있듯이 1단계 환경에서는 학습 기반 방법들이 uniform sampling 기반 방식보다 경로 길이 와 플래닝 시간은 감소하였고 성공률은 증가하였다. 이는 학습에 사용한 환경과 비슷한 환경을 사용하였기 때문이다. 2단계 환경은 시작자세와 도착자세 바뀌는 환경이기 때문에 1단계 환경보다 어려운 환경이다. 2단계 환경에서의 실험 결과인 [Table 2]에서 LSG-BS 방법의 성공률이 가장 높았으며 경로 길이와 플래닝 시간에서는 두번째로 좋은 성능을 보였다. 종합적인 성능이 가장 좋다고 할 수 있다. [Table 3]에 따르면 가장 높은 일반화 성능이 필요한 단계인 3단계 환경에서는 제안한 방법인 LSG-BS 방법의 성능이 3가지 지표 모두 좋았을 뿐 아니라 같은 학습기반 방법과 비교하였을 때에도 성능에서 차이를 보였다. 기존 방법인 LS 방법은 1단계 2단계 환경에서는 비교적 괜찮은 성능을 보였지만 일반화가 많이 필요한 3단계 환경에서는 uniform sampling에 비해 성능이 크게 증가하지 않았다.

Level 1 motion planning results of various sampling strategies with an identical obstacle and start/goal poses from trained data

Level 2 motion planning results of various sampling strategies with an identical obstacle and non-identical start/goal poses from trained data

Level 3 motion planning results of various sampling strategies with non-identical obstacles and start/goal poses from trained data

전체 실험 결과를 분석하였을 때, Gaussian 노이즈를 추가하는 방법은 학습된 분포보다 넓은 영역을 포함하여 성공률을 높이는데 기여한다. 스텝 전략에 따른 비교에서는 Bounded 방식이 평균 경로 길이 측면에서 우수한 성능을 보였으며, 반면 Swing 방식은 트리의 빠른 확장을 통해 계산 시간을 효과적으로 단축시켰다. 두 가지 스텝 전략을 모두 사용한 방법이 성공률, 경로길이 그리고 플래닝 시간에서 모두 좋은 성능을 보였다. 일반화 성능도 제안한 샘플링 전략이 기존 학습기반 방법에 비해 나아졌다.

실시간 적용 가능성을 평가하기 위해 연산 속도와 플래닝 시간을 분석한 결과, 모션 플래닝 시간은 평균적으로 약 0.1초 이내로 소요되며, 1,000개의 학습 샘플 생성에는 Nvidia RTX 4080 그래픽카드 기준으로 약 0.078초가 걸린다. 이러한 샘플들은 모션 플래닝 전에 미리 생성이 가능하므로, 환경 인식이 빠르게 이루어진다는 가정 하에 실시간 적용이 가능할 것으로 예상된다.

제안한 샘플링 전략은 기존 학습 기반 방법에 비해 성공률과 경로 길이 그리고 플래닝 시간에서 우수한 성능을 보였다. 기존 학습 기반 방법에 비해 모션 플래닝에 필요한 시간이 43.69% 감소하였으며 시간이 많이 단축되었음에도 불구하고 경로 길이는 4.64% 감소하였고 성공률 또한 2% 증가하였다. 또한 기존 학습 기반 방법에 비해 일반화 성능이 나아졌다. 결론적으로 BiRRT* 알고리즘과의 조합을 통해, 제안한 방법인 양방향 트리의 특성을 활용한 샘플링 전략은 기존 방법에 비해 더 효율적임을 확인하였다.


5. 결론 및 한계

본 연구에서는 로봇 모션 플래닝의 효율성과 성공률을 향상시키기 위해, 스텝을 활용한 샘플링 전략과 Gaussian 노이즈를 추가하는 방법을 제안했다. CVAE 모델을 활용하여 상태 공간에서 최적 경로를 포함할 가능성이 높은 영역을 식별하고, 이러한 영역에서 샘플링 할 수 있는 분포를 학습했다. 실험 결과 bias sampling을 진행할 때 노이즈를 추가하게 되면 모션 플래닝의 성공률은 증가하는 반면, 경로길이는 감소하는 것을 확인했다. 또한 Swing 스텝 샘플링 전략을 통해 모션 플래닝 시간을 감소시킬 수 있었고 Bounded 스텝 샘플링 전략을 통해 모션 플래닝으로 구한 경로 길이를 감소시킬 수 있었다. 두 가지 샘플링 전략을 같이 사용한 방법을 통해 기존 학습 기반 방법보다 모션 플래닝 성능을 향상시킬 수 있었다.

제안한 방법은 특정 환경과 한팔 매니퓰레이터를 대상으로 시뮬레이션에서 실험을 통해 성능을 검증하였으며, 이를 통해 모션 플래닝 성능을 개선하였다. 향후 연구에서는 다양한 환경과 다양한 로봇을 대상으로 성능을 평가하여, 제안한 방법의 일반화 가능성을 검증할 계획이다. 특히, 복잡한 제약조건을 가지는 작업이나 양팔 매니퓰레이터와 같은 고차원 로봇에도 적용할 수 있는 학습 방법과 모델을 개발하여 성능을 향상시키고자 한다. 또한, 본 연구에서는 정적 환경에서 성능을 평가하였으나, 실제 환경에서는 장애물이 움직이거나 목표점이 변동될 가능성이 있다. 향후 연구에서는 동적 환경에서도 제안한 방법의 성능을 평가하고, 온라인 학습 기반의 실시간 샘플링 조정 및 적응형 탐색 기법을 적용하여 실험할 계획이다.

Acknowledgments

This work was supported by Samsung Advanced Institute of Technology (SAIT).

References

  • N. Correll, K. E. Bekris, D. Berenson, O. Brock, A. Causo, K. Hauser, K. Okada, A. Rodriguez, J. M. Romano, and P. R. Wurman, “Analysis and observations from the first Amazon Picking Challenge,” IEEE Transactions on Automation Science and Engineering, vol. 15, no. 1, pp. 172-188, Jan., 2018. [https://doi.org/10.1109/TASE.2016.2600527]
  • S. Karaman, M. R. Walter, A. Perez, E. Frazzoli, and S. Teller, “Anytime Motion Planning using the RRT*,” 2011 IEEE International Conference on Robotics and Automation, Shanghai, China, pp. 1478-1483, 2011. [https://doi.org/10.1109/ICRA.2011.5980479]
  • B. Ichter, E. Schmerling, T.-W. E. Lee, and A. Faust, “Learned Critical Probabilistic Roadmaps for Robotic Motion Planning,” 2020 IEEE International Conference on Robotics and Automation (ICRA), Paris, France, pp. 9535-9541, 2020. [https://doi.org/10.1109/ICRA40945.2020.9197106]
  • A. Orthey, C. Chamzas, and L. E. Kavraki, “Sampling-Based Motion Planning: A Comparative Review,” Annual Review Control, Robotics, and Autonomous Systems, vol. 7, no. 1, pp. 285-310. [https://doi.org/10.1146/annurev-control-061623-094742]
  • S. LaValle, “Rapidly-Exploring Random Trees: A New Tool for Path Planning,” Research Report 9811, Iowa, USA, [Online], https://msl.cs.illinois.edu/~lavalle/papers/Lav98c.pdf, .
  • L. E. Kavraki, M. N. Kolountzakis, and J.-C. Latombe, “Analysis of Probabilistic Roadmaps for Path Planning,” IEEE Transactions on Robotics and Automation, vol. 14, no. 1, pp. 166-171, Feb., 1998. [https://doi.org/10.1109/70.660866]
  • B. Ichter, J. Harrison, and M. Pavone, “Learning Sampling Distributions for Robot Motion Planning,” 2018 IEEE International Conference on Robotics and Automation (ICRA), Brisbane, Australia, pp. 7087-7094, 2018. [https://doi.org/10.1109/ICRA.2018.8460730]
  • T. McMahon, A. Sivaramakrishnan, E. Granados, and K. E. Vekris, “A Survey on the Integration of Machine Learning with Sampling-based Motion Planning,” Foundations and Trends in Robotics, vol. 9, no. 4, pp. 266-327. [https://doi.org/10.1561/2300000063]
  • C. Chamzas, A. Cullen, A. Shrivastava, and L. E. Kavraki, “Learning to Retrieve Relevant Experiences for Motion Planning,” 2022 International Conference on Robotics and Automation (ICRA), Philadelphia, PA, USA, pp. 7233-7240, 2022. [https://doi.org/10.1109/ICRA46639.2022.9812076]
  • C. Chamzas, Z. Kingston, C. Quintero-Peña, A. Shrivastava, and L. E. Kavraki, “Learning Sampling Distributions Using Local 3D Workspace Decompositions for Motion Planning in High Dimensions,” 2021 IEEE International Conference on Robotics and Automation (ICRA), Xi’an, China, pp. 1283-1289, 2021. [https://doi.org/10.1109/ICRA48506.2021.9561104]
  • J. Wang, W. Chi, C. Li, C. Wang, and M. Meng, “Neural RRT*: Learning-Based Optimal Path Planning,” IEEE Transactions on Automation Science and Engineering, vol. 17, no. 4, pp. 1748-1758, Oct., 2020. [https://doi.org/10.1109/TASE.2020.2976560]
  • R. Kumar, A. Mandalika, S. Choudhury, and S. Srinivasa, “LEGO: Leveraging Experience in Roadmap Generation for Sampling-Based Planning,” 2019 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), Macau, China, pp. 1488-1495, 2019. [https://doi.org/10.1109/IROS40897.2019.8968503]
  • A. H. Qureshi and Y. Ayaz, “Intelligent bidirectional rapidly-exploring random trees for optimal motion planning in complex cluttered environments,” Robotics and Autonomous Systems, vol. 68, pp. 1-11. [https://doi.org/10.1016/j.robot.2015.02.007]
  • D. P. Kingma, D. J. Rezende, S. Mohamed, and M. Welling, “Semi-Supervised Learning with Deep Generative Models,” arXiv:1406.5298, 2014. [https://doi.org/10.48550/arXiv.1406.5298]
  • D. Berenson, S. Srinivasa, and J. Kuffner, “Take Space Regions: A framework for pose-constrained manipulation planning,” The International Journal of Robotics Research, vol. 30, no. 12, pp. 1432-1460. [https://doi.org/10.1177/0278364910396389]
  • D.P. Kingma and M. Welling, “Auto-Encoding Variational Bayes,” arXiv:1312.6114, 2013. [https://doi.org/10.48550/arXiv.1312.6114]
전 수 현

2023 서울대학교 기계공학과(학사)

2023~현재 서울대학교 지능정보융합학과 석사, 박사 통합과정

관심분야: Robot Learning, Motion Planning, Manipulation

김 민 수

2018 한양대학교 기계공학과(공학사)

2018~현재 서울대학교 융합과학기술대학원 석사, 박사 통합과정

관심분야: Autonomous Vehicle (Parking), Data-driven Motion (Path) Planning for Robots

장 준 원

2005 한양대학교 전기 전자 컴퓨터공학부(공학사)

2007 서울대학교 전기 컴퓨터공학부(공학석사)

2007~현재 삼성전자 SAIT

2022~현재 서울대학교 지능 정보융합학과 박사과정

관심분야: Motion planning, Deep reinforcement learning

장 민 수

2016 서강대학교 기계공학과(공학사)

2018 서강대학교 기계공학과(공학석사)

2022 서강대학교 기계공학과(공학박사)

2022~현재 삼성전자 SAIT

관심분야: Mobile Manipulator, Human-Robot Interaction

박 재 흥

1995 서울대학교 항공우주공학과(공학사)

1997 서울대학교 항공우주공학과(공학석사)

2006 Stanford University Aero/Astro.(공학박사)

2009~현재 서울대학교 융합과학기술 대학원 교수

관심분야: Robot-environment Interaction, Multi Contact Control, Whole Body Control

[Fig. 1]

[Fig. 1]
Differences in sampling methods based on sampling distribution selection ratios, yellow means uniform sampling, green means bias sampling, bias ratio (Left: 0, Middle: 0.5, Right: 1)

[Fig. 2]

[Fig. 2]
Neural network model for learning sampling distribution, (Left) training model, (Right) inference model

[Fig. 3]

[Fig. 3]
A step-based sampling strategy, Swing (Top) and Bounded (Bottom) steps, where the step variable discretizes the path between the start (0) and goal (1) points. Grey objects are obstacles. Swing sampling: Reflects the alternating node generation characteristic of the BiRRT algorithm by sampling step within [0, 0.5] for the Start Tree (orange area) and sampling step within [0.5, 1] for the Goal Tree (blue area). Bounded Sampling: Utilizes the distance between trees and sample within a calculated lower and upper bound (green area), with approximated bounds determined by specific formulas during the BiRRT process

[Fig. 4]

[Fig. 4]
Data generation scenario with a 7-DOF manipulator moving a cup between shelves in a bookshelf, with three randomly placed cuboid obstacles in RViz

[Fig. 5]

[Fig. 5]
t-SNE visualization of neural sample paths generated by the CVAE model, where the color transitions from yellow to purple as the step variable changes from 0 to 1

[Table 1]

Level 1 motion planning results of various sampling strategies with an identical obstacle and start/goal poses from trained data

Method Path length Planning time (sec) Success rate (%)
US 7.218 0.134 0.87
LS 6.839 0.060 0.96
LSG 6.588 0.050 0.98
LSG-S 6.992 0.057 0.94
LSG-B 6.557 0.056 0.95
LSG-BS 6.399 0.040 0.97

[Table 2]

Level 2 motion planning results of various sampling strategies with an identical obstacle and non-identical start/goal poses from trained data

Method Path length Planning time (sec) Success rate (%)
US 7.568 0.130 0.88
LS 6.849 0.080 0.94
LSG 6.914 0.070 0.95
LSG-S 6.955 0.045 0.94
LSG-B 6.564 0.093 0.95
LSG-BS 6.590 0.053 0.97

[Table 3]

Level 3 motion planning results of various sampling strategies with non-identical obstacles and start/goal poses from trained data

Method Path length Planning time (sec) Success rate (%)
US 7.775 0.142 0.89
LS 7.201 0.119 0.92
LSG 7.226 0.100 0.91
LSG-S 7.187 0.109 0.93
LSG-B 6.891 0.079 0.94
LSG-BS 6.867 0.067 0.94