
인간-로봇 상호작용에서의 작업 계획 수립을 위한 연속 수어 인식
CopyrightⓒKROS
Abstract
In real-world human-robot interaction (HRI) environments, voice-based interfaces often face limitations due to noise, language barriers, and communication with users who have hearing or speech impairments. As a result, gesture-based interaction using sign language is gaining attention as an intuitive and non-verbal alternative. However, conventional systems rely on one-to-one mapping of static gestures to predefined commands or use gestures merely as a supplementary input to voice recognition, limiting contextual understanding and flexibility. This study proposes an end-to-end framework that captures continuous sign language gestures via camera, interprets the user’s intent using a large language model (LLM), and translates this intent into executable robotic actions. The proposed system consists of a bidirectional long short term memory-based sign language recognizer, an LLM-based intent reconstruction module, and the Scene describer that extracts scene elements, including objects and humans, to facilitate plan generation. Experimental evaluations confirm that the proposed framework provides a viable alternative to traditional language-based methods in settings where verbal communication is challenging.
Keywords:
Continuous Sign Language Recognition, Large Language Model (LLM), Robot Manipulator1. 서 론
최근 인간-로봇 상호작용(Human-Robot Interaction, HRI) 분야에서는 인간의 의도를 효과적으로 전달하기 위한 언어 기반 입력 방식, 즉 음성이나 텍스트를 활용한 연구가 활발히 이루어지고 있다[1-4]. 예를 들어, Davila[5]는 외과 수술 로봇 보조 시스템을 위한 음성 제어 인터페이스를 제안하였으며, Whisper 음성 인식 모델을 통합하여 실시간 음성 명령의 해석과 실행을 가능하게 하였다. 해당 시스템은 조직 조작 실험을 통해 높은 인식 정확도와 실용성을 입증하였다. Aguilera[6]은 유아 교육 환경에서 활용할 수 있는 음성 제어 로봇 시스템을 제안하였는데, 이를 통해 만 4세 아동도 자연어 명령을 통해 협동 로봇과 상호작용할 수 있도록 하였다. 이 시스템은 음성-텍스트 변환, 대규모 언어모델(Large Language Model, LLM), 객체 인식 모듈을 결합한 형태로, 대규모 언어모델을 활용한 로봇 작업 계획의 실현 및 응용 가능성을 보였다. 이와 같이 언어 기반 접근법은 직관적이고 구현이 용이하다는 장점이 있으나, 실제 환경에서는 여러 한계가 존재한다. 대표적으로, 실제 산업 및 협업 환경에서는 기계 소음이나 주변 대화 소리로 인해 음성 인식의 신뢰도가 크게 저하될 수 있으며, 다국적 구성원이 참여하는 작업 현장의 경우, 억양, 발음, 언어적 배경의 차이로 인해 사용자 별 인식률이 불균형하게 나타나는 문제가 발생할 수 있다[7]. 또한, 청각 또는 언어 장애를 가진 사용자의 경우 음성 인식 기술의 적용 자체가 근본적으로 제한된다. 이러한 한계로 인해 제스처 기반 입력은 음성과 텍스트 입력의 한계를 대체하거나 보완할 수 있는 유망한 대안으로 주목받고 있다[8-10]. 특히 수어는 손, 얼굴, 신체 움직임을 활용한 시각적 제스처로 구성되어 있어, 음성 입력이 제한되는 상황에서도 원활한 의사소통을 가능하게 한다. 또한, 알파벳부터 단어, 구문에 이르는 다양한 언어적 단위를 표준화된 문법과 구조로 표현할 수 있다는 점에서, HRI 분야의 효과적인 의사소통 수단으로서 큰 잠재력을 지닌다. 이러한 특성으로 인해 수어는 청각장애인과 비장애인 모두에게 중요한 소통 매개체일 뿐 아니라, 소음이 많은 산업 환경과 같이 음성 기반 입력이 취약한 실제 산업 현장에서도 유용하게 활용될 수 있다. 수어 인식 기술은 일반적으로 고립 수어 인식(Isolated sign language recognition, ISLR)과 연속 수어 인식(Continuous sign language recognition, CSLR)으로 구분된다[11-14]. ISLR은 단어 수준의 정적인 수어를 인식하는 데 초점을 맞추며, 주로 단일 손동작의 분류에 기반한다. 반면, CSLR은 문장 단위의 흐름 속에서 시간적·맥락적 관계를 강조하며, 비디오에서 주어진 수어를 시계열 데이터로 해석하여 문장의 전반적 의미를 이해하는 것을 목표로 한다. CSLR은 실제 대화 상황에서 자연스러운 수어 흐름을 처리하는 데 핵심적인 역할을 하며, 현실적인 수어 기반 상호작용 시스템 개발에 필수적이다. 최근 CSLR 연구에서는 3차원 자세 추정(3D pose estimation)[15], 그래프 합성곱 신경망(Graph convolutional network, GCN)[16,17], Transformer 기반 구조[15,18], Bi-LSTM (Bidirectional LSTM) 및 CTC (Connectionist temporal classification) 기반 시퀀스 모델링[13,16]과 같은 기술들이 적극 활용되고 있다. 이러한 방법들은 글로스, 즉, 수어의 의미 단위를 분절하고 자연어 문장을 생성하는 단계까지 확장되면서, 수어 인식 기술을 더욱 고도화된 응용으로 발전시키고 있다.
한편, 제스처 인식을 로봇 제어 입력으로 활용하려는 다양한 시도가 이루어져 왔다[19]. 그러나 대부분의 기존 접근법들은 사전에 정의된 정적 제스처를 특정 명령에 단순 매핑하거나, 손동작을 직접 제어 신호로 사용하는 방식에 의존한다. 이러한 방법은 직관적이고 단순하다는 점에서 장점이 있으나, 제스처의 맥락적 의미를 해석하거나 사용자의 고차원적 의도를 추론하는 유연성이 부족하다. 실제로 많은 경우 제스처는 음성이나 텍스트 입력의 보조 수단에 머물거나, 의미적 처리 없이 단순 제어 신호로만 활용되는 한계를 보인다[20-22]. 이에 반해 수어는 본질적으로 시간적으로 연속된 제스처로 구성되며, 문맥적 해석을 필요로 한다. 따라서 사전 정의된 정적 제스처 매핑 방식만으로는 사용자의 의도를 정확하게 파악하기 어렵다.
이러한 한계를 극복하기 위해 본 연구에서는 수어 입력으로부터 사용자의 의도를 추론하여 로봇 팔 작업 계획으로 연결하는 end-to-end 프레임워크를 제안한다. 제안하는 시스템은 CSLR 모듈, 대규모 언어모델(Large language model. LLM) 기반 의도 복원(Gesture-to-Intent Reconstruction, GIR) 및 작업 계획 생성 모듈로 구성된다. CSLR 단계에서는 Bi-LSTM 기반 모델을 활용하여 연속 수화수어 입력을 처리한다. 해당 모델은 연속 수어 패턴을 학습하여 프레임 단위로 단어를 순차적으로 예측하며, 이후 필터링 알고리즘을 통해 오검출 된 단어를 제거한다. 비록 CSLR의 출력이 문법적으로 불완전한 단어 또는 구로 이루어져 있더라도, 제안하는 프레임워크는 LLM의 강점인 자연어 이해 기능을 통해 사용자의 의도를 복원하고 해석한다. 또한, 필터링 알고리즘을 통해 후처리된 CSLR 출력과 작업 공간 정보를 제공하는 Scene Describer 모듈의 출력은 In-context learning (ICL)을 통해 초기화된 LLM 에 함께 입력된다. 이를 바탕으로 LLM은 GIR 모듈을 통해 사용자의 의도를 복원하고, 해당 의도에 부합하는 작업 계획을 생성한다. 이러한 방식으로 제안하는 프레임워크는 수어를 자연어 수준에서 해석하여 로봇 작업 계획과 연계함으로써, 언어 기반 입력이 제한된 환경에서도 안정적이고 지능적인 인간-로봇 상호작용을 가능하게 한다. 실험 결과를 통해 제안한 방법의 성능을 두 가지 측면에서 검증하였다. 첫째로, 다양한 소음 환경과 다국적 협업 환경에서의 원·비원어민 억양 및 언어적 다양성으로 인한 음성 인식 성능 저하 문제를 고려하여, 기존 음성 인식 기반 제어와 제안한 수어 인식 기반 제어의 성능을 비교 분석하고, 이를 통해 음성 인식의 한계를 확인함과 동시에 수어 입력 기반 제어 방식의 대안적 입력 수단으로서의 유효성과 실용성을 검증하였다. 다음으로, 명령어의 복잡도를 단순·반복·복합 명령의 3단계로 분류하여 제안한 프레임워크의 end-to-end 성공률을 평가함으로써, 제안한 프레임워크가 명령 복잡도에 관계없이 높은 신뢰성을 보임을 입증하였다.
2. 제안 방법
2.1 전체 시스템 개요
[Fig. 1]은 본 연구에서 제안하는 프레임워크의 전체 구조를 나타낸다. RGB 카메라로 촬영된 사용자의 수어 입력은 Bi-LSTM 기반 CSLR 모듈에 의해 처리되어 프레임 단위의 단어 예측 결과가 생성된다. 이후 필터링 알고리즘을 적용하여 연속된 수어 동작 사이에서 발생할 수 있는 오검출되거나 과검출된 반복 단어를 제거함으로써 결과를 후처리한다. 후처리된 연속 단어 정보는 Scene Describer 모듈을 통해 추출된 객체 및 사용자 정보가 LLM 기반 작업 계획 모듈로 입력된다. 작업 계획 모듈은 ICL을 통해 초기화되며, 사용자의 의도를 자연어 형태로 복원하고 이를 실행 가능한 로봇 작업 계획으로 변환한다. 최종적으로 생성된 고수준 작업 계획은 로봇으로 전송되어, 객체 작업 및 사용자와 상호작용을 수행할 수 있게 된다.
Overall workflow of the proposed framework: sequential video frames containing only sign gestures (without any speech input) are processed by a Bi-LSTM-based CSLR module to predict continuous sign gestures, after which the prediction results undergo a filtering process. The post-processed data, together with scene information, are then fed into the LLM-based task planning module, where the user’s intent is reconstructed and translated into an executable robot plan
2.2 연속 수어 인식 모델
본 연구에서 제안하는 CSLR 단계에서는 Bi-LSTM을 활용하여 연속 수어로부터 프레임별로 단어를 추출한다. 특히 Bi-LSTM은 과거와 미래 맥락을 동시에 고려하는 구조적 특성 덕분에, 수어와 같은 연속 입력의 인식 성능을 효과적으로 향상시킨다. 모델은 연속 수어 제스처 영상과 프레임 단위 단어 라벨이 포함된 데이터셋을 기반으로 학습된다. 또한 연속 수어 동작 사이에서 발생할 수 있는 불필요한 움직임이나, 수어가 반복됨으로써 생기는 과검출 문제를 해결하기 위해 필터링 알고리즘을 적용하여 잘못 인식되거나 반복되는 단어를 제거한다.
학습을 위한 데이터셋은 사전에 정의된 연속 수어를 수행하는 사람의 영상 촬영을 통해 구축하였다. 데이터 셋 구축을 위해 영상으로부터 손의 자세와 상태 정보를 추출하였으며, Mediapipe[23]를 이용해 총 21개의 손 관절 랜드마크 J를 연속적으로 획득하였다. 각 랜드마크는 3차원 좌표 (xi, yi, zi)와 가시성 정보 vi로 구성되며, 다음과 같이 정의된다:
| (1) |
다음으로, 손가락의 마디별 관절 벡터 vk를 계산하기 위해, 먼저 각 랜드마크 ji로부터 3차원 좌표를 추출하여 다음과 같이 정의한다:
| (2) |
그 후, 각 관절 벡터 vk는 다음과 같이 표현된다 :
| (3) |
즉, 식 (3)과 같이, k번째 마디의 관절 벡터인 vk는 마디의 시작점 pparent(k)와 끝점 pchild(k)를 통해 얻은 벡터를 정규화하여 얻는다. 이 과정을 통해 손가락 관절 간의 상대적 방향을 결정할 수 있다. 이어서, k번째 마디 사이 각도 θk는 식 (4)를 통해 다음과 같이 계산된다.
| (4) |
이 과정을 통해 총 15개의 관절 간 상호 각도가 계산되며, 이는 손의 자세를 정량적으로 나타내는 손동작 표현 벡터로 구성된다:
| (5) |
식 (1)과 식 (5)를 통해 얻어진 손의 랜드마크 정보 J(21개 x 3차원 = 63개), 각도 정보 θ(15개), 그리고 각 프레임에 해당하는 수어 클래스 l(1개)로 구성된 데이터는 다음과 같이 구조화된다:
| (6) |
따라서 추출된 데이터는 각 프레임에 대해 손 정보 J, 각도 정보 θ, 단어 레이블 l을 포함하여 총 100개의 입력 데이터 포인트로 구성되며, 모델 입력 데이터는 N개씩 그룹화되어 다음과 같이 처리된다 :
| (7) |
식 (7)의 모델 입력 데이터 X는 연속된 N개 프레임의 시퀀스로 그룹화되어 Bi-LSTM을 훈련시키기 위해 입력된다. Bi-LSTM은 시퀀스를 순방향과 역방향 모두에서 처리하여, 각 시간 단계에서 과거와 미래의 맥락 정보를 모두 통합할 수 있으므로 이를 통해 연속 수어 제스처의 순차적 흐름을 보다 정확하게 포착할 수 있다. 모델의 출력은 전체 시퀀스에 걸친 정보를 통합하고 가장 높은 신뢰도가 높은 수어 클래스를 선택함으로써 예측된다.
또한, CSLR 모델의 신뢰성을 향상시키기 위해 필터링 알고리즘([Algorithm 1])을 적용한다. 이 알고리즘은 연속 수어의 특성을 고려하여 잘못된 예측과 중복 검출을 제거함으로써 후속 작업 계획의 정확도를 개선하는 작업을 수행하며, 그 절차를 요약하면 다음과 같다.
- 1) 각 프레임의 모델 출력을 집합 D에 수집하고, D의 길이가 N에 도달하면, D의 최빈값을 Si로 설정하고 D를 비워 다음 N개 프레임에 대해 동일한 과정을 반복한다.
- 2) 위 과정을 반복하여 생성된 Si와 직전 결과 Si-1를 비교하여 반복되는 제스처를 필터링하여 동일한 출력값이 최종 출력값O에 지속적으로 누적되는 것을 방지한다.
이러한 필터링 과정은 연속 수어 인식 중에 발생하는 오검출을 제거하고 중복으로 검출된 결과가 누적되지 않도록 하여, 최종적으로 LLM 기반 작업 계획 모듈의 정확도를 개선하는 역할을 한다.
2.3 장면 묘사 모듈
장면 묘사 모듈(Scene Describer)은 심층인공신경망 기반 객체인식 모델(e.g., YOLO 등)과 Mediapipe를 활용하여 작업공간 내 객체와 사용자 손 위치를 실시간으로 인식하고, 3D Point cloud 기술을 통해 정확한 객체 위치 및 그리퍼 최적 각도를 계산하여 LLM에 전달하기 위해 구성되었다([Fig. 2]).
Scene Describer: Object and hand detection system with 3D point cloud analysis and PCA-based gripper orientation calculation
먼저, 작업공간에 무작위로 배치된 객체들을 조작하기 위해 각 객체의 형태와 위치 정보를 분석하여 최적의 그리퍼 접근 각도를 도출해야 한다. 이를 위한 그리퍼 접근 각도 결정에는 다양한 방법이 있으나[24-26], 본 연구에서는 PCA (Principal Component Analysis)를 사용하여 물체의 주축 방향을 추출하고 최적의 그리핑 각도를 도출한다. 이를 통해 바나나, 박스 등 다양한 형태의 객체에 대해 맞춤형 조작이 가능하다.
또한, 작업공간 내에 사용자의 손이 감지되는 경우, Mediapipe를 활용하여 손의 위치를 인식한다. 이렇게 획득된 손 위치 정보는 사용자와 로봇 간의 협업 상호작용에 필수적인 데이터로 활용되며, 로봇 팔이 사용자에게 객체를 건네주거나 사용자로부터 객체를 건네받을 때 적절한 위치 정보를 제공한다. 이를 통해 사용자는 로봇과 원활하게 협업하여 작업공간 내 객체들에 대한 다양한 협력 작업을 수행할 수 있다.
장면 묘사 모듈로부터 얻어진 정보는 다음과 같은 형식으로 표현된다 :
| (8) |
여기서 ci는 작업공간 내 i번째 객체의 클래스를 나타내고, pi는 해당 객체의 3차원 위치 정보를 의미하며, ai는 객체 조작을 위한 적절한 그리퍼 각도를 나타낸다. LLM은 장면 묘사 모듈을 통해 추출된 L 정보를 기반으로 사용자의 입력 명령에 따른 적절한 작업 계획을 생성한다.
2.4 LLM 기반 의도 복원 및 작업 계획
[Fig. 3]은 제안하는 LLM 기반 작업 계획 모듈의 전체 과정을 보여준다. 필터링된 CSLR 결과로부터 입력된 [Me, Banana, Give, Redbox, Tray, Move]와 같이 순서나 문법이 맞지 않는 단어 나열과, Scene Describer가 제공하는 작업공간 정보가 LLM에 함께 입력된다. LLM 기반의 의도복원 및 작업계획 모듈은 이러한 입력으로부터 사용자의 의도를 문맥적으로 복원하고, 이를 로봇이 수행할 수 있는 구체적인 작업 계획으로 변환하여 출력한다. 특히 본 모듈은 기계 소음이나 주변 대화 소리로 인해 음성 인식의 신뢰도가 저하되는 산업 현장과, 다국적 구성원이 함께 작업하는 협업 환경에서 발생하는 억양·발음·언어적 배경의 다양성에도 강인하게 동작할 수 있다. 이러한 환경에서는 음성 명령의 오류 가능성이 높아지거나 언어적 표현 차이로 인한 인식 편차가 발생할 수 있으므로, 본 연구에서는 음성 인식이 제한된 상황에서도 수어 입력만으로 사용자의 의도를 정확하게 복원하고 일관된 작업 계획을 생성할 수 있도록 LLM을 구성하였다.
Overview of LLM-based intent reconstruction and task planning process: Filtered CSLR results and workspace information from the Scene Describer are processed by the LLM-based task planner initialized with ICL, enabling reconstruction of user intent and generation of executable task plans for collaborative object manipulation
제안된 LLM 기반 작업 계획 모듈은 ICL을 통해 초기화되어 중간 단계 없이 단일 모델 내에서 사용자의 의도 복원과 작업 계획 생성을 통합적으로 수행하도록 설계되었다. LLM의 자연어 이해 능력을 바탕으로 필터링 알고리즘을 거친 결과에서 의도를 복원하며, 문장 구조나 어순이 부자연스러운 경우에도 문맥과 의미를 파악할 수 있다. 이러한 특성은 언어별로 문법과 음성학이 다를 수 있는 다국어 협업 환경에서 특히 유용하며, 연속 수어 입력에서 발생할 수 있는 순서 오류나 문법적 부정확성을 효과적으로 보완한다.
구체적으로 LLM에는 필터링 알고리즘을 통해 후처리된 출력 O와 Scene Describer 모듈의 출력L을 입력으로 받아, 다음의 3단계 규칙 구조에 따라 작업 계획을 생성한다([Fig. 3]).
- 1. 의도 복원 규칙 – 사용자가 시간 순서대로 입력한 단어열(예: ME, BANANA, GIVE, RED_BOX)을 기반으로, 문법적 결함이 있더라도 LLM이 문맥을 해석하여 자연어 문장 형태로 의도를 복원한다.
- 2. 작업 계획 규칙 – 복원된 의도에 따라 객체 조작, 로봇 팔의 이동, 사용자에게의 전달 및 수취 동작을 단계적으로 분해하여, 이를 로봇 제어 명령어 형태(예: ArmMotion() – 로봇 팔 제어, ObjectPicking() – 객체 파지, ObjectPlacing() – 객체 배치, HandoverToHuman() – 사용자에게 전달, ReceiveFromHuman() – 사용자로부터 수취)로 변환한다.
- 3. 위치 매핑 규칙 – Scene Describer에서 제공한 객체의 좌표 및 각도 정보를 참조하여, 목표 위치를 실제 좌표값(X, Y, Z)으로 변환하고, 이를 기반으로 작업 계획을 생성한다.
또한, Few-Shot In-Context Example을 함께 제공하여 LLM이 새로운 시나리오에서도 안정적이고 일관된 출력 구조를 유지하도록 하였다. Few-shot 예제는 입력(JSON 객체 정보 + 사용자 명령)과 이에 대응하는 출력(의도 복원 결과 + 작업 계획 코드)의 짝 구조로 구성되며, 최소 5개 이상의 예시를 포함한다. 예를 들면, “User Command: MOVE GREEN_BOX TRAY → [Restored Intent: Move the green box to the tray] → [Output Code: ArmMotion([0.3, 0.2, 0.5]); ObjectPicking(); ArmMotion([0.1, −0.4, 0.1]); ObjectPlacing();]” 같은 형태로, LLM이 단일 모델 내에서 이러한 과정을 통합적으로 처리할 수 있도록 설계되었다.
이 과정을 통해 생성된 고수준 작업 계획은 실시간 커널을 통해 실행되어 사용자와 로봇 간의 실시간 협업을 가능하게 한다. 요약하면, 본 연구의 프레임워크는 CSLR 모듈, 필터링 알고리즘, Scene Describer, LLM 기반 작업 계획 모듈을 유기적으로 통합하여 연속 수어 기반의 로봇 팔 제어 시스템을 구현하며, 다양한 시나리오에서 유연하고 직관적인 HRI를 실현할 수 있음을 보여준다.
3. 실 험
3.1 실험 설계
본 연구에서는 제안된 연속 수어 기반 HRI 프레임워크의 실용적 타당성과 성능을 검증하기 위해 2가지 실험을 설계하였다. 실험은 7자유도 Franka Emika Research 3 로봇과 Intel RealSense D435i 깊이 카메라, GPT-4 Turbo를 사용하여 수행되었으며, 수어 인식부터 장면 이해, 사용자 인식, 작업 실행까지의 전 과정을 단일 카메라로 처리하도록 시스템을 구성하였다.
또한, 제안된 프레임워크의 학습 및 검증을 위해 구축된 데이터셋은 2.2절에서 기술한 구성 방식을 기반으로, 명령어를 구성하는 세 가지 핵심 요소인 동작(action), 객체(object), 위치(position)를 조합하여 설계되었다. 구체적으로, 동작은 move, give, take의 3종, 객체는 banana, red cube, green cube의 3종, 위치는 me, tray, left, right의 4종으로 총 10개의 인식 어휘를 포함한다. 각 어휘(라벨)마다 10개의 단일 수어 영상을 촬영하여 총 100개의 단일 수어 데이터를 구축하였으며, 이 단일 수어 영상들을 다양한 조합 형태의 명령 시나리오(에피소드)로 구성하여 모델의 학습 및 검증에 활용하였다. 이러한 데이터셋 구성은 세 가지 핵심 요소인 동작(action), 객체(object), 위치(position)를 조합함으로써, 3.3절의 실험에서 시나리오 복잡도 수준(simple, repetitive, complex)에 따른 모델의 일반화 성능을 효과적으로 평가할 수 있도록 설계되었다.
3.2 소음 및 다국적 환경에서의 음성 인식 평가
기존 연구에 따르면 소음 환경에서 음성 인식 성능이 현저히 저하되며, 비원어민 화자의 인식 정확도는 원어민에 비해 상당히 낮은 것으로 나타났다[27,28]. 특히 최근 연구들은 텍스트 음성 변환(TTS) 시스템을 활용하여 다양한 억양의 영어 음성을 생성하고 국적별 화자 간 인식 성능 차이를 분석함으로써 이러한 취약성을 부각시켰다[29-32]. 이러한 접근법에 따라 본 연구에서는 Google TTS를 활용하여 원어민과 비원어민 억양을 비교하여 실험하고, 실제 소음 환경에서의 인식 성능을 평가하였다. 이를 바탕으로 첫 번째 실험을 설계하여 기존 음성 기반 제어 방법의 실용적 한계를 확인하고 수어 기반 입력의 필요성 및 확장 가능성을 입증하고자 하였다.
실험은 음성 인식과 수어 인식의 성능을 비교하기 위해 두 가지 입력 방식을 각각 독립적으로 수행하였다. 먼저, 음성 인식 실험은 백색 소음, 대화 소음, 기계 소음의 세 가지 환경(각각 50 dB, 70 dB, 100 dB)에서 동일한 명령 문장을 원어민과 비원어민 억양으로 영어로 발화하여 진행하였으며, Google Speech-to-Text API를 이용해 인식률을 측정하였다. 한편, 제안된 프레임워크의 수어 인식 실험은 Bi-LSTM 기반 CSLR 모델을 통해 연속 수어 입력을 인식하고, 필터링 알고리즘 및 LLM 기반 의도 복원 모듈을 거쳐 결과를 산출하였다. 이때 사용된 데이터셋은 동작(Action) 3종(move, give, take), 객체(Object) 3종(banana, red cube, green cube), 위치(Position) 4종(me, tray, left, right)으로 구성된 총 10개의 인식 어휘로 이루어졌다. 인식 어휘를 조합하여 구성한 명령을 음성 인식과 수어 인식 모두 각각 20회 반복 수행하였다.
실험 결과, [Table 1]과 같은 결과를 얻을 수 있었다. 먼저, 백색 소음 환경(약 50 dB)에서는 원어민과 비원어민 억양의 음성 인식률이 각각 95%와 90%로 높게 나타났다. 그러나 소음 수준이 기계 소음(70 dB)으로 증가하면서 인식 정확도는 원어민 억양 81%, 비원어민 억양 68%로 감소하였다. 이러한 경향은 혼합 소음 환경(대화 소음과 기계 소음이 결합된 100 dB)에서 더욱 두드러져, 인식률이 원어민 억양 63%, 비원어민 억양 31%로 급격히 저하되었다. 반면, 제안된 CSLR 모델은 모든 소음 조건에서 일관되게 약 95%의 높은 인식 정확도를 유지하였다. 특히 이 모델은 소음에 대한 강인성뿐만 아니라 사용자의 언어적 배경(원어민 또는 비원어민)에 관계없이 안정적인 성능을 보여주어, 다양한 실제 환경에서의 견고성과 신뢰성을 입증하였다. 이러한 결과는 기존의 음성 기반 로봇 제어 시스템이 음성이 정확하게 인식된다는 이상적 가정에 크게 의존하고 있음을 시사하며, 연속 수어 입력 모델이 실제 환경에서 높은 견고성을 유지할 수 있는 신뢰성 있는 대안임을 명확히 보여준다.
3.3 프레임워크 전체 성능 평가
제안된 로봇 제어 프레임워크가 연속 수어 인식부터 의도 복원, 작업 계획, 로봇 제어까지 실제 환경에서 얼마나 안정적으로 작동하는지를 평가하기 위해, [Table 2]에 나타나 있듯이 명령문의 복잡도(단순, 반복, 복합)에 따라 세 가지 수준으로 구성된 실험을 설계하였다. 각 수준별로 3개의 수어 명령(총 9개)을 설계하였으며, 모든 명령은 3회씩 반복 수행하여 총 27회 에피소드로 구성하였다. 이를 통해 제안된 프레임워크의 인식 및 계획 성능을 평가하였다([Fig. 4]). 실험에 사용된 수어 명령 세트는 3가지 동작(give, move, take), 4가지 목표 위치(me, tray, left, right), 3가지 객체(red box, green box, banana)로 구성된 총 10개 항목으로 설계되었다.
시나리오의 복잡도는 명령문을 구성하는 동작(Action), 객체(Object), 목표 위치(Target)의 수 및 조합 관계를 기준으로 정의하였다. 단순(Simple) 시나리오는 각 요소가 한 번씩만 등장하는 기본 명령으로 구성되며, 반복(Repetitive) 시나리오는 하나 이상의 요소가 두 번 이상 반복되는 명령으로 구성된다.복합(Complex) 시나리오는 세 가지 요소(동작·객체·위치)가 복합적으로 조합되어 세 번 이상 등장하거나 연속적으로 수행되는 명령으로 정의된다([Fig. 4], [Table 2]).
각 환경에서 CSLR 모듈은 사용자의 연속 수어를 인식하고, 필터링 알고리즘을 통해 후처리되었다. 이후 LLM 기반 작업 계획 모듈이 입력을 바탕으로 의미를 복원하고, Scene Describer 모듈에서 제공하는 장면 정보와 결합하여 작업 계획을 생성하였다. 마지막으로 로봇이 계획을 실행하였다.
이때, 장면 묘사(Scene Describer) 모듈은 객체별로 PCA 기반 자세 추정 방식을 적용하여, 장면 내 객체의 위치와 형태를 인식하고 그리퍼의 접근 방향과 파지점을 산출하였다([Fig. 5]). [Table 3]는 본 실험에서 사용된 비정형 객체(unstructured object)인 banana와 정형 객체(structured object)인 red cube, green cube에 대한 정량적 성능 평가 결과를 제시한다. 여기서 λ₁/λ₂비율은 객체의 형태적 비대칭성을 나타내는 지표로, 값이 높을수록 길쭉한 형태, 낮을수록 대칭적 형태를 의미한다. 카메라의 위치를 고정한 상태에서 객체의 배치를 무작위로 변경하며 20회 반복 실험을 수행한 결과, λ₁/λ₂ 비율, 파지점 오차, 그리고 자세(그리퍼 각도) 추정에서 모두 [Table 3]와 같은 안정적인 성능을 확인하였다. 이러한 결과를 통해 장면 묘사 모듈의 인식 오차가 전체 프레임워크의 학습 및 검증 성능에 유의미한 영향을 미치지 않았음을 검증하였다.
실험에서 프레임워크 전체 성능 평가는 두 단계로 이루어졌다. 첫째, CSLR 모듈이 사용자의 수어를 올바르게 인식했는지 확인하고, 둘째, 생성된 작업 계획이 오류 없이 실행되었는지 검사하였다. 수어 인식 정확도는 단순 명령에서 95%로 가장 높았으며, 반복 명령에서 92%, 복합 명령에서 85%로 점진적인 감소를 보였다. 마찬가지로 작업 계획 및 실행 성공률도 단순 명령에서 95%로 가장 높았으며, 반복 명령과 복합 명령에서 각각 90%와 82%로 감소하였다([Fig. 6]). 이러한 결과는 시스템이 단순 명령에 대해서는 높은 신뢰성과 정확도를 유지하지만, 명령 구조의 복잡성이 증가할수록 수어 인식과 계획 실행의 난이도가 높아짐을 나타낸다. 대부분의 실패가 CSLR 모델의 인식 오류에서 비롯되었다는 점을 통해 긴 명령 문장일수록 정확한 인식과 의도 복원이 더욱 어려워짐을 시사한다.
전체적으로 본 시스템은 다양한 복잡도의 명령을 안정적으로 처리할 수 있는 가능성을 보여주었으나, 본 실험을 통해 동시에 복합 명령 처리 성능 향상을 위한 추가 연구의 필요성이 제기되었다.
4. 결 론
본 연구에서는 연속 수어 입력을 통해 사용자의 의도를 추론하고 이를 로봇 동작으로 직접 변환하는 end-to-end HRI 프레임워크를 제안하였다. 제안된 시스템에서는 연속 수어를 중간 단계 없이 곧바로 작업 계획으로 변환하는 파이프라인을 구축하였으며, CSLR 모듈, 필터링 알고리즘, Scene Describer 모듈, LLM 기반 의도 복원 및 작업 계획 모듈을 유기적으로 통합하였다. 이를 통해 문법적으로 불완전한 입력이라 하더라도, 제안한 LLM 기반 모듈은 사용자의 의도를 효과적으로 복원하고 상황에 적합한 계획을 생성할 수 있도록 하였다. 실험 결과, 제안된 프레임워크는 다양한 소음 환경과 원·비원어민 억양에서도 기존 음성 인식이 급격히 성능 저하를 보인 것과 달리 약 95%의 안정적인 인식률을 유지하였다. 또한 단순·반복·복합 명령으로 구성된 시나리오에서도 각각 95%, 90%, 82%의 계획 실행 성공률을 기록하여, 명령 복잡도에 따른 성능 차이는 있으나 전반적으로 높은 신뢰성과 실용성을 입증하였다. 이는 수어 기반 입력이 음성이나 텍스트 입력이 제한되는 실제 산업·협업 환경에서 기존 언어 기반 제어를 보완하거나 대체할 수 있는 강력한 대안임을 보여준다. 한편, 수어 인식은 조명 변화나 손의 가림 등 시각적 조건에 따라 인식 정확도가 영향을 받을 수 있으나, 향후 연구에서 다중 시점 입력과 조명 보정 전처리를 통해 이러한 한계를 완화할 수 있다. 또한 음성 인터페이스가 소음 환경에서 취약한 반면 수어는 비언어적·시각적 상호작용에 강점을 가지므로, 두 방식은 상호 보완적으로 결합될 때 더욱 안정적이고 유연한 HRI 구현이 가능하다. 추가적으로, 본 연구에서는 트랜스포머[33] 기반의 최신 수어 인식 구조 대신 Bi-LSTM 기반 모델을 채택하였다. 이는 본 연구의 주된 목적이 수어 인식 성능의 고도화보다는 수어 입력을 활용한 로봇 작업 계획 프레임워크의 제안과 가능성 검증에 있었기 때문이다. 향후 연구에서는 트랜스포머 기반 연속 수어 인식 모델을 통합하여 Bi-LSTM 구조와의 성능을 비교·분석하고, 대규모 데이터셋을 활용한 정량적 향상 효과 검증을 수행할 예정이다. 마지막으로, 본 연구에서 제안한 시스템은 사용자의 수어 입력으로부터 로봇 작업 계획으로의 단방향 입력 처리 구조를 따르기 때문에, 로봇 작업 중 사용자 의도 수정, 재입력, 실행 후 검증과 같은 양방향 상호작용 기능은 아직 지원하지 않는다. 향후 연구에서는 오류 검출 및 피드백 루프를 포함한 양방향 상호작용 기능을 추가하고, 수어와 음성을 결합한 다중 모달 입력 방식을 확장함으로써 보다 직관적이고 유연한 HRI를 구현할 예정이다.
Acknowledgments
This research was supported by the Gyeongsangbuk-do RISE (Regional Innovation System & Education) project (Specialized University unit).
References
-
T. Wang, P. Zheng, S. Li, and L. Wang, “Multimodal Human-Robot Interaction for Human-Centric Smart Manufacturing: A Survey,” Advanced Intelligent Systems, vol. 6, no. 3, pp. 2300359, 2024.
[https://doi.org/10.1002/aisy.202300359]
-
F. Zeng et al., “Large Language Models for Robotics: A Survey,” arXiv preprint arXiv:2311.07226, 2023.
[https://doi.org/10.48550/arXiv.2311.07226]
-
M.-Y. Park, W.-J. Jung, M.-J. Kim, and K. M. Park, “Robot Task Planning Based on Voice Command and Object Detection,” The Journal of Korea Robotics Society, vol. 19, no. 4, pp. 347-353.
[https://doi.org/10.7746/jkros.2024.19.4.347]
-
J.-H. Choi, H.-J. Baek, C.-S. Park, and I. Kim, “Utilizing AI Foundation Models for Language-Driven Zero-Shot Object Navigation Tasks,” The Journal of Korea Robotics Society, vol. 19, no. 3, pp. 293-310.
[https://doi.org/10.7746/jkros.2024.19.3.293]
-
A. Davila, J. Colan, and Y. Hasegawa, “Voice control interface for surgical robot assistants,” 2024 International Symposium on Micro-NanoMechatronics and Human Science (MHS), Nagoya, Japan, pp. 1-5, 2024.
[https://doi.org/10.1109/MHS63891.2024.10856297]
-
C. A. Aguilera, A. Castro, C. Aguilera, and B. Raducanu, “Voice-Controlled Robotics in Early Education: Implementing and Validating Child-Directed Interactions Using a Collaborative Robot and Artificial Intelligence,” Applied Sciences, vol. 14, no. 6, pp. 2408.
[https://doi.org/10.3390/app14062408]
-
M. Del Río et al., “Accents in Speech Recognition through the Lens of a World Englishes Evaluation Set,” Research in Language, vol. 21, no. 3, pp. 225-244.
[https://doi.org/10.18778/1731-7533.21.3.02]
-
H. Chen, M. C. Leu, and Z. Yin, “Real-Time Multi-Modal Human-Robot Collaboration Using Gestures and Speech,” Journal of Manufacturing Science and Engineering, vol. 144, no. 10, pp. 101007, 2022.
[https://doi.org/10.1115/1.4054297]
-
L.-H. Lin, Y. Cui, Y. Hao, F. Xia, and D. Sadigh, “Gesture-Informed Robot Assistance via Foundation Models,” Proceedings of the 7th Annual Conference on Robot Learning (CoRL), Atlanta, USA, pp. 3061-3082, 2023.
[https://doi.org/10.48550/arXiv.2309.02721]
-
H. Nakagawa, S. Hasegawa, Y. Hagiwara, A. Taniguchi, and T. Taniguchi, “Pointing Frame Estimation with Audio-Visual Time Series Data for Daily Life Service Robots,” 2024 the IEEE International Conference on Systems, Man, and Cybernetics (SMC), Kuching, Malaysia, pp. 2949-2956, 2024.
[https://doi.org/10.1109/SMC54092.2024.10831649]
-
N. Sarhan and S. Frintrop, “Unraveling a Decade: A Comprehensive Survey on Isolated Sign Language Recognition,” 2023 IEEE/CVF International Conference on Computer Vision Workshops (ICCVW), Paris, France, pp. 3210-3219, 2023.
[https://doi.org/10.1109/ICCVW60793.2023.00345]
-
O. M. Sincan and H. Y. Keles, “Using Motion History Images with 3D Convolutional Networks in Isolated Sign Language Recognition,” IEEE Access, vol. 10, pp. 18608-18618.
[https://doi.org/10.1109/ACCESS.2022.3151362]
-
L. Hu, L. Gao, Z. Liu, and W. Feng, “Continuous Sign Language Recognition with Correlation Network,” 2023 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), Vancouver, BC, Canada, pp. 2529-2539, 2023.
[https://doi.org/10.1109/CVPR52729.2023.00249]
-
A. S. M. Miah, M. A. M. Hasan, S. Nishimura, and J. Shin, “Sign Language Recognition Using Graph and General Deep Neural Network Based on Large Scale Dataset,” IEEE Access, vol. 12, pp. 12345-12355.
[https://doi.org/10.1109/ACCESS.2024.3372425]
-
J. Eunice, Y. Sei, and D. J. Hemanth, “Sign2pose: A Pose-Based Approach for Gloss Prediction Using a Transformer Model,” Sensors, vol. 23, no. 5, pp. 2853.
[https://doi.org/10.3390/s23052853]
-
M. Parelli, K. Papadimitriou, G. Potamianos, G. Pavlakos, and P. Maragos, “Spatio-Temporal Graph Convolutional Networks for Continuous Sign Language Recognition,” ICASSP 2022 - 2022 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), Singapore, Singapore, pp. 8457-8461, 2022.
[https://doi.org/10.1109/ICASSP43922.2022.9746971]
-
Q. Guo, S. Zhang, L. Tan, K. Fang, and Y. Du, “Interactive attention and improved GCN for continuous sign language recognition,” Biomedical Signal Processing and Control, vol. 85, pp. 104931, 2023.
[https://doi.org/10.1016/j.bspc.2023.104931]
-
Q. Guo, S. Zhang, and H. Li, “Continuous Sign Language Recognition Based on Spatial-Temporal Graph Attention Network,” CMES - Computer Modeling in Engineering & Sciences, vol. 134, no. 3, pp. 1653-1670.
[https://doi.org/10.32604/cmes.2022.021784]
-
J. Qi, L. Ma, Z. Cui, and Y. Yu, “Computer vision-based hand gesture recognition for human-robot interaction: a review,” Complex & Intelligent Systems, vol. 10, no. 1, pp. 1581-1606.
[https://doi.org/10.1007/s40747-023-01173-6]
-
H. Ali, D. Jirak, and S. Wermter, “Snapture — a Novel Neural Architecture for Combined Static and Dynamic Hand Gesture Recognition,” Cognitive Computation, vol. 15, no. 6, pp. 2014-2033, 2023.
[https://doi.org/10.1007/s12559-023-10174-z]
-
M. Peral, A. Sanfeliu, and A. Garrell, “Efficient Hand Gesture Recognition for Human-Robot Interaction,” IEEE Robotics and Automation Letters, vol. 7, no. 4, pp. 10272-10279.
[https://doi.org/10.1109/LRA.2022.3193251]
-
A. Vysocký, T. Poštulka, J. Chlebek, T. Kot, J. Maslowski, and S. Grushko, “Hand Gesture Interface for Robot Path Definition in Collaborative Applications: Implementation and Comparative Study,” Sensors, vol. 23, no. 9, pp. 4219.
[https://doi.org/10.3390/s23094219]
-
C. Lugaresi et al., “Mediapipe: A Framework for Building Perception Pipelines,” arXiv preprint arXiv:1906.08172, 2019.
[https://doi.org/10.48550/arXiv.1906.08172]
-
H.-S. Fang, C. Wang, M. Gou, and C. Lu, “Graspnet-1Billion: A Large-Scale Benchmark for General Object Grasping,” IEEE/CVF Conference on Computer Vision and Pattern Recognition, Seattle, WA, USA, pp. 11444-11453, 2020.
[https://doi.org/10.1109/CVPR42600.2020.01146]
-
J. Mahler et al., “Dex-Net 2.0: Deep Learning to Plan Robust Grasps with Synthetic Point Clouds and Analytic Grasp Metrics,” arXiv:1703.09312, 2017.
[https://doi.org/10.48550/arXiv.1703.09312]
-
Y.-T. Oh and J.-B. Song, “Unstructured Bin-Picking System Based on Korean Speech Recognition,” The Journal of Korea Robotics Society, vol. 20, no. 2, pp. 331-336.
[https://doi.org/10.7746/jkros.2025.20.2.331]
-
R. Prabhavalkar, T. Hori, T. N. Sainath, R. Schlüter, and S. Watanabe, “End-to-End Speech Recognition: A Survey,” IEEE/ACM Transactions on Audio, Speech, and Language Processing, vol. 32, pp. 325-351.
[https://doi.org/10.1109/TASLP.2023.3328283]
-
S. Alharbi et al., “Automatic Speech Recognition: Systematic Literature Review,” IEEE Access, vol. 9, pp. 131858-131876.
[https://doi.org/10.1109/ACCESS.2021.3112535]
-
M. H. Asyrofi, F. Thung, D. Lo, and L. Jiang, “CrossASR: Efficient Differential Testing of Automatic Speech Recognition via Text-To-Speech,” 2020 IEEE International Conference on Software Maintenance and Evolution (ICSME), Adelaide, Australia, pp. 640-650, 2020.
[https://doi.org/10.1109/ICSME46990.2020.00066]
-
P. Dubey and B. Shah, “Deep Speech Based End-to-End Automated Speech Recognition (ASR) for Indian-English Accents,” arXiv:2204.00977, 2022.
[https://doi.org/10.48550/arXiv.2204.00977]
-
C.-T. Do, S. Imai, R. Doddipatla, and T. Hain, “Improving Accented Speech Recognition Using Data Augmentation Based on Unsupervised Text-to-Speech Synthesis,” 2024 32nd European Signal Processing Conference (EUSIPCO), Lyon, France, pp. 136-140, 2024.
[https://doi.org/10.23919/EUSIPCO63174.2024.10715166]
-
G. Karakasidis et al., “Multilingual TTS Accent Impressions for Accented ASR,” 26th International Conference on Text, Speech, and Dialogue (TSD), Pilsen, Czech Republic, pp. 317-327, 2023.
[https://doi.org/10.1007/978-3-031-40498-6_28]
-
A. Vaswani et al., “Attention Is All You Need,” 31st Conference on Neural Information Processing Systems (NIPS 2017), Long Beach, CA, USA, pp. 6000-6010, 2017.
[https://doi.org/10.48550/arXiv.1706.03762]
2020~현재 국립금오공과대학교 전자공학과(학사)
관심분야: AI Robotics, Robot Foundation Model
2012 아주대학교 전자공학부(공학사)
2020 포항공과대학교 전자전기공학과(공학박사)
2020~2021 포항공과대학교 전자전기공학과 박사후연구원
2021~현재 국립금오공과대학교 조교수
관심분야: 지능제어, 강인제어, 모터제어, 인공지능, 로봇제어, 전력시스템 제어 및 상태추정

![[Algorithm 1] [Algorithm 1]](/xml/49583/JKROS_2026_v21n2_148_f007.jpg)
![[Table 1]](../img/npr_tablethum.jpg)
![[Fig. 4] [Fig. 4]](/xml/49583/JKROS_2026_v21n2_148_f004.jpg)
![[Fig. 5] [Fig. 5]](/xml/49583/JKROS_2026_v21n2_148_f005.jpg)
![[Fig. 6] [Fig. 6]](/xml/49583/JKROS_2026_v21n2_148_f006.jpg)