퀄컴 NPU서 로봇 AI 추론 속도 '7배 가속'까지 성공…정확도 손실 1%포인트 이내 '주목'
[프라임경제] 인공지능(AI) 모델 경량화 및 최적화 기술 기업 노타(486990)가 퀄컴 테크날러지스의 산업용 시스템온칩 '퀄컴 드래곤윙 IQ-9075(QualcommTM IQ-9075)' 프로세서의 신경망처리장치(NPU)에서 로봇 AI 모델과 실행 환경을 최적화해 실제 로봇팔의 작업 속도를 기존 대비 3배 높였다고 22일 밝혔다.
노타는 외부 서버에 의존하지 않고 비전언어행동모델을 로봇 내부 NPU에서 직접 구동해 실제 작업 성능 개선으로 연결해 AI 모델뿐 아니라 반도체 연산 구조와 런타임, 실제 로봇 환경까지 아우르는 엔드투엔드 최적화 역량을 입증했다.
성능 검증은 언어 명령에 따라 로봇팔이 큐브를 집어 반대편 매트로 옮기는 작업을 대상으로 진행했다. 그 결과 비전언어행동모델의 추론 속도는 최대 7배 빨라졌고, 실제 물체 이동 작업 속도도 3배 향상됐다.
작업 성공률은 92%로, 원본 모델의 93%와 비교해 1%포인트 내의 정확도 손실을 확인했다. 추론 속도와 작업 속도를 크게 높이면서도 원본 모델 수준의 성능을 유지한 것이다.
이번 성과의 핵심은 고성능 그래픽처리장치(GPU)나 외부 서버에서 구동하던 로봇 AI 모델을 최적화해 로봇에 연결된 '드래곤윙 IQ-9075' 프로세서 기반의 엣지 AI 보드에서 직접 실행할 수 있도록 구현한 데 있다.
나아가 추론 속도 향상을 실제 로봇의 작업 속도와 성공률 개선으로 연결했다.
비전언어행동모델은 연산량과 메모리 사용량이 많아 전력과 컴퓨팅 자원이 제한된 로봇 내부에서 구동하려면 모델과 실행 환경 전반의 최적화가 필요하다.
이를 위해 노타는 비전언어행동모델(VLA)에 특화한 경량화부터 NPU 연산 그래프 최적화, 멀티 NPU 런타임 구축, 행동 생성 가속까지 전 과정을 최적화했다.
이후 실제 로봇팔과 연결해 카메라 영상 인식부터 언어 명령 이해, 행동 생성과 실행까지 이어지는 엔드투엔드 환경에서 추론 속도와 작업 속도, 모델 정확도, 작업 성공률을 종합적으로 검증했다.
추론 속도는 카메라 영상과 언어 명령이 입력된 뒤 모델이 로봇의 다음 행동을 생성하기까지 걸리는 시간을 의미한다. 추론 속도가 빨라지면 로봇이 다음 동작을 결정하고 실행하기까지의 대기시간이 줄어들어 변화하는 주변 환경에 실시간으로 대응할 수 있다.
이는 로봇 작업의 정확성과 안정성에도 직접적인 영향을 미친다. 모델이 판단하는 동안에도 로봇은 움직이고 주변 환경은 계속 변하기 때문이다. 추론이 지연되면 로봇이 이미 달라진 상황을 바탕으로 행동해 반응성과 동작 정확도가 떨어지고 작업 실패 가능성도 커질 수 있다.
특히 로봇 파운데이션 모델은 텔레오퍼레이션(Teleoperation) 등을 통해 수집한 연속적인 행동 궤적을 학습한다. 실제 구동 과정에서 추론 지연이 발생하면 모델이 학습한 행동의 시간적 흐름과 로봇이 움직이는 시점 사이에 차이가 생길 수 있다.
로봇 AI 최적화는 단순히 큰 모델을 작게 만들고 빠르게 구동하는 것을 넘어, 모델이 학습한 행동을 실제 환경에서도 적절한 시점에 안정적으로 수행하도록 만드는 기술인 셈이다.
노타는 해당 기술이 적용된 실제 로봇팔 시연을 'Korea Real-World AI Network(KRAIN) 2026'에서 공개했다. 행사 부스에서는 최적화 전후의 로봇 작업과 실측 결과를 비교해 추론 속도 개선이 실제 작업 속도와 안정성에 미치는 영향을 보여줬다.
'KRAIN 2026'은 과학기술정보통신부가 주최하는 행사로, 정부의 ‘하이퍼 AI 네트워크 전략’에 따라 추진되는 AI 네트워크 실증 사업을 소개하고 산업별 적용 사례와 표준 제안을 점검하기 위해 마련됐다.
올 하반기 서울에서 열리는 AI-RAN 얼라이언스 총회를 앞두고 개최되는 사전 쇼케이스로, 피지컬 AI 구현을 위한 네트워크 기술과 국내 실증 성과를 국내외 기업에 선보였다.
채명수 노타 대표는 “이번 성과는 노타가 쌓아온 AI 최적화 기술력이 모델의 크기나 추론 속도 개선에 그치지 않고, 실제 로봇의 반응성과 작업 성능으로 이어질 수 있음을 보여준 사례”라며, “앞으로 다양한 AI 모델과 하드웨어를 아우르는 최적화 레이어를 지속적으로 확장하고 고도화해 모바일과 엣지, 데이터센터를 넘어 로봇과 휴머노이드를 비롯한 피지컬 AI 전반으로 기술 적용과 사업 영역을 확대해 나가겠다”고 말했다.
한편 노타는 LG전자, 모빌린트와 함께 정부의 K-온디바이스 AI 반도체 기술개발 사업 휴머노이드 분야 국책과제에 참여하고 있다. 해당 사업에서 노타는 AI 모델 최적화 세부 과제의 주관기관을 맡아 비전언어행동모델을 국산 NPU와 실제 로봇 환경에 맞춰 최적화해 작업의 속도와 정확도를 높이고 있다.
노타는 이번 퀄컴 NPU 기반 로봇 실증과 국산 NPU 기반 휴머노이드 프로젝트를 통해 다양한 AI 반도체와 로봇 환경을 아우르는 피지컬 AI 최적화 역량을 강화하고 있다.