챌린지
MARC 2026 의 무대는 실제 세종대학교 캠퍼스를 그대로 옮긴 가상 환경(디지털 트윈) 입니다. 이곳에서 여러분은 사람의 말을 알아듣고, 캠퍼스 CCTV 영상을 살펴보며, 로봇을 움직이는 하나의 AI 에이전트를 만들게 됩니다.
예를 들어 누군가 “벤치 옆에 두고 온 우산을 찾아줘”라고 말하면, 에이전트는 그 말을 이해하고 CCTV 영상에서 우산이 어디에 있는지 찾아냅니다. 만약 “가져다줘”라고 하면, 이번에는 로봇이 그 자리로 가서 우산을 집어 정해진 장소로 옮깁니다.
이 페이지에서는 그 미션이 어떤 과제로 나뉘어 겨뤄지는지(Stage 1·2)와 함께, 무엇이 미리 주어지고, 여러분이 직접 만들어야 하는 것은 무엇이며, 어떤 지식과 기술이 필요한지를 차근차근 정리했습니다.
대회는 두 단계(Stage) 로 이뤄집니다. 참가자는 Stage 1 만 참가할지, 아니면 Stage 1 과 Stage 2 를 모두 참가할지 먼저 정한 뒤 참가 신청을 합니다. 로봇 제어(이동·조작)에 자신이 없다면 Stage 1 만 참가하는 것으로 신청하면 됩니다. 두 단계는 다음과 같습니다.
Stage 1 — 찾고, 위치 알아내기
에이전트는 사람의 말에서 무엇을 찾아야 하는지를 이해한 다음, 캠퍼스 고정 CCTV 영상을 분석해 그 대상이 어디에 있는지를 알아내 위치(좌표)로 제출합니다. 대상은 잃어버린 물건일 수도, 도움이 필요한 사람일 수도 있습니다.
특히 사람의 말은 대상을 생김새가 아니라 주변 사물과의 관계로 가리키는 경우가 많습니다. 예를 들어 “벤치 주변의 우산“이라고 하면, 비슷하게 생긴 여러 우산 중에서 ‘벤치’라는 다른 사물과의 위치 관계를 분석해야 올바른 대상을 골라낼 수 있습니다. 따라서 에이전트는 “옆에·위에·주변에·뒤에” 같은 관계 표현을 이해하고, 장면 속 사물들 사이의 관계를 해석할 수 있어야 합니다.
- 고정 CCTV 영상을 분석해 대상(분실물 또는 사람)의 위치 좌표를 제출합니다.
- 또는, 위급·이상상황에 처한 사람을 찾아냅니다(SAR).
즉 Stage 1 은 사람의 말이 어떤 대상을 가리키는지 정확히 알아내고, CCTV 영상에서 그 대상의 위치를 찾아 정확히 보고하는 능력을 평가합니다.
Stage 1 은 여러 라운드로 진행됩니다. 라운드마다 주어지는 문제에 답안을 제출하며, 각 라운드에서 받은 점수의 평균이 Stage 1 의 최종 점수가 됩니다.
Stage 2 — 회수하기
Stage 1 의 모든 라운드를 마치면 Stage 2 가 자동으로 이어서 시작되며, 이때 주어지는 문제는 대상을 “가져다줘” 라고 요청하는 명령입니다. Stage 2 는 Stage 1 과 똑같이, 먼저 VLA 그라운딩으로 대상을 찾는 것에서 시작합니다. 즉 에이전트는 사람의 말을 이해하고 주변 사물과의 관계까지 해석해 어떤 물건을, 어디에서 찾아야 하는지를 먼저 알아냅니다.
대상을 찾은 다음에는 그 물건을 실제로 수거하기 위해 로봇을 움직입니다. 로봇은 캠퍼스 통로를 따라 목표 위치까지 스스로 이동(내비게이션) 하고, 도착하면 로봇에 달린 다양한 센서로 정확한 물건의 위치를 계산하여 로봇팔로 집어 로봇에 달린 바구니에 담습니다. 물건을 바구니에 실은 뒤에는 지정된 장소까지 이동해 물건을 전달하고 임무를 마칩니다. 이렇게 집어서 바구니에 담아 옮기는 동작을 Pick-and-Place (집어서 옮기기) 라고 부릅니다. 좁은 공간에서 부딪히지 않게 경로를 잡고, 물건을 정확하고 안정적으로 집어 올리는 일이 이 단계의 핵심입니다.
- 대상을 찾고(VLA 그라운딩), 로봇팔로 집어 바구니에 담아 지정된 장소로 가져다 둡니다.
Stage 2 는 Stage 1 의 찾기(VLA 그라운딩) 에 더해, 캠퍼스를 이동하는 내비게이션과 로봇팔로 물건을 다루는 조작 능력(여러 방향으로 자유롭게 움직이는 6축 관절 로봇팔, 6DoF)까지 이어서 수행해, 물건을 실제로 회수해 제자리에 가져오는 능력을 평가합니다.
주최가 제공하는 것
참가 팀이 밑바닥부터 만들 필요는 없습니다. 개발에 필요한 것은 스타터킷
(marc-starter-kit) 하나로 제공되며, 여러분은 그 위에 ‘지능’만 얹으면 됩니다. 스타터킷에는
다음이 들어 있습니다.
- 시뮬레이션 플랫폼(연습용) — 대회를 운영·채점하는 것과 동일한 환경을 내 컴퓨터에서
실행하는 도구(
marc.sh)입니다. 실제 대회와 같은 조건에서 미리 개발하고 검증할 수 있습니다.- 세종대 캠퍼스 디지털 트윈 — 실제 캠퍼스를 3D 로 옮긴 Isaac Sim 기반 가상 환경.
- 로봇 · 센서 — 4륜 이동 로봇(적재용 바구니 탑재), 6축 로봇팔, 고정 CCTV, 로봇 스테레오 카메라.
- 표준 인터페이스 — 로봇 제어와 센서 입력을 ROS2 표준 메시지로 주고받습니다.
- 훈련용 예시 문항 · 공개 시나리오 — 실제 문제와 같은 형식의 연습 문항과 연습용 배경(chungmu)을 포함합니다.
- 데이터셋 생성기 — 인식 모델을 훈련시킬 때 필요한 훈련용 데이터셋을 자동으로 만들어
주는 도구입니다.
- 대회용 사물(에셋) — 대회에 등장하는 다양한 물건으로 물건 인식용 데이터셋을 생성합니다.
- 사람(SAR) — 위급·이상상황에 처한 사람을 알아보도록 사람 인식용 데이터셋을 생성합니다.
- 매니퓰레이션 훈련 도구 — 로봇팔로 물건을 집어 바구니에 담는 동작(Pick-and-Place)을 연습·훈련할 수 있는 모듈입니다.
- 참가자 SDK (
marc-sdk) — 플랫폼과 통신하며 입력(관측)을 받고, 답안을 제출하고, 점수를 확인하는 파이썬 라이브러리입니다. - 데모(참조 구현) — 내비게이션 · 로봇팔 집기 · VLA 로 이어지는 동작 예제입니다. 제출 전 예시(mock) 추론 부분을 본인의 실제 구현으로 교체합니다.
여러분이 개발하는 것
여러분이 만드는 것은 로봇의 ‘두뇌’ 역할을 하는 AI 에이전트(소프트웨어) 하나입니다. 이 에이전트는 다음을 스스로 해내야 합니다.
- 명령 이해 — 사람이 일상 언어로 내리는 지시를 알아듣는 일입니다. 대상은 “벤치 옆의 우산“처럼 주변 사물과의 관계로 설명되는 경우가 많으므로, 그 말이 무엇을(어떤 물건·사람), 어떤 관계로, 어디에서 찾으라는 것인지 정확히 풀어내야 합니다. 또 위치만 알려주는 “찾아줘”인지, 직접 가져오는 “가져다줘”인지도 구분합니다.
- CCTV 인지 — 캠퍼스 곳곳의 고정 CCTV 영상을 분석해 찾는 대상이 어디에 있는지 알아내는 일입니다. 여러 화면 중 어느 카메라에 대상이 보이는지 고르고, 비슷하게 생긴 물건들 사이에서 정답을 가려냅니다. 같은 영상에서 위급·이상상황에 처한 사람(SAR) 도 함께 알아챕니다.
- 로봇 제어 — “가져다줘” 명령일 때, 찾은 위치로 로봇을 안전하게 이동시키고, 도착하면 로봇팔로 물건을 집어 바구니에 담은 뒤 지정된 장소로 옮기는 일입니다. 좁은 길에서 부딪히지 않게 경로를 세우고, 물건을 정확히 집어내는 판단이 필요합니다.
하드웨어·물리 시뮬레이션·통신은 플랫폼이 처리하므로, 여러분은 인지·판단·제어 로직에만 집중하면 됩니다.
중요 — 에이전트는 오프라인에서 동작해야 합니다. 예선 채점 환경과 본선 데모 환경 모두 인터넷 접속이 제한됩니다. 따라서 상용 AI API(클라우드 LLM 등)를 호출할 수 없으며, 에이전트가 사용하는 모델·데이터는 모두 제출물 안에 담아 인터넷 없이 실행되도록 해야 합니다.
알아야 할 지식 · 겨뤄지는 기술 요소
아래 기술들이 이 대회에서 실제로 점수로 겨뤄지는 요소입니다. 처음부터 전부를 완벽히 알아야 하는 것은 아니며, 스타터킷과 개발자 가이드가 출발점을 제공합니다. 참가 방식에 따라 필요한 기술이 다릅니다.
Stage 1(찾기) — 모든 참가자 공통
| 기술 요소 | 무엇을 하나 |
|---|---|
| 비전-언어 그라운딩(VLA) | 사람의 말을 장면 속 실제 대상과 연결합니다. |
| 공간 관계 추론 | “벤치 옆의 우산”처럼 사물 사이의 관계를 해석해 비슷한 대상 중 정답을 고릅니다. |
| 인지(탐지·위치추정) | CCTV 영상에서 대상을 찾아 그 위치를 추정합니다. |
Stage 1 + 2(회수) — Stage 2 까지 참가할 때 추가로 필요
| 기술 요소 | 무엇을 하나 |
|---|---|
| 내비게이션 | 캠퍼스 통로를 따라 목표 위치까지 충돌 없이 이동합니다. |
| 매니퓰레이션 | 6축 로봇팔로 물건을 안정적으로 집어 바구니에 담습니다(그랩 포즈). |
| ROS2 로봇 제어 | 로봇 이동·로봇팔 동작을 표준 메시지로 명령합니다. |
평가 방식 (개요)
예선
- 주최 측이 참가 팀의 제출물을 플랫폼에서 실행해 자동으로 채점된 결과를 확인
- 자동 채점 점수와 논문 심사 결과를 종합해 본선 진출 팀 선정(진출 / 미진출)
- 본선 진출 팀에게 IEEE Xplore 논문 게재 자격 부여
본선
- 진출 팀이 현장에서 논문 발표와 실시간 시연(라이브 데모) 진행
- 두 평가를 종합해 최종 순위 결정
본선 진행 현장 사정으로 라이브 데모가 어려울 경우, 주최 측이 본선을 앞두고 참가 팀의 제출물을 직접 실행·녹화해 준비한 데모 영상을 재생하는 것으로 라이브 데모를 대신할 수 있습니다.
지금 시작하기
제공되는 리소스 에서 개발자 가이드·스타터킷·SDK 를 받아 개발을 시작하고, 참가 등록 으로 팀 ID 를 발급받으세요. 정확한 입출력·채점 규격은 개발자 가이드 에서 확인할 수 있습니다.