N.O.V.A. 2026 팀 브리핑
팀 내부 브리핑비공식 자료2026.09.30 기준

N.O.V.A. 2026

대화형 의료 진단 AI 에이전트 대회

Navigating Optimal clinical decisions via Virtual-patient Agents

가상 환자에게 묻고, 진찰하고, 검사를 골라 진단까지 가는 Doctor Agent를 만드는 대회입니다. 예선에서는 모든 팀이 같은 모델 gpt-oss-20b를 씁니다. 그래서 점수 차이는 모델을 둘러싼 설계에서 납니다.

접수 마감 10.03(토)D-3 온라인 개회식 10.06(화)D-6 예선 시작 10.12(월)D-12
PART 0LLM 첫 수업의사 팀원을 위한 세 교시. 직접 눌러 보며 익힙니다
0-1 · 1교시

LLM은 아주 복잡한 함수 하나입니다

수학의 f(x)를 떠올려 보세요. x를 넣으면 y가 나옵니다. LLM도 같습니다. x에는 글이 들어가고, y로는 그 뒤에 이어질 말이 나옵니다. 정확히는 이어질 말의 후보마다 확률이 나옵니다.

1

입력은 글, 출력은 다음 말의 확률

‘안녕하’를 넣으면 f는 ‘세요’ 82%, ‘신가요’ 7%처럼 다음에 올 조각마다 확률을 계산합니다. 확률이 가장 높은 ‘세요’를 고르면 ‘안녕하세요’가 됩니다. 이 조각을 토큰이라고 부릅니다. 함수 안에는 이 계산에 쓰는 숫자(파라미터)가 들어 있고, gpt-oss-20b에는 약 210억 개가 들어 있습니다.

실험 1 · f(x)에 글 넣어 보기시뮬레이션 · 확률은 설명용 예시
x · 입력한 글
안녕하
y · 다음 토큰의 확률
    P(“세요” | “안녕하”) = 0.82
      2

      문장은 f를 여러 번 불러서 만듭니다

      f는 한 번에 한 조각만 냅니다. 나온 조각을 x 뒤에 붙여 다시 넣고, 또 다음 조각을 받습니다. 끝 표시가 나올 때까지 반복하면 문장이 됩니다. 실험 1의 ‘끝까지 자동으로’가 바로 이 반복입니다.

      1회x₁ = 안녕하 → f → 세요
      2회x₂ = 안녕하세요 → f → ,
      3회x₃ = 안녕하세요, → f → 반갑습니다
      …끝 표시가 가장 높은 확률로 나오면 멈춥니다
      3

      대화는 대본을 이어 쓰는 트릭입니다

      그러면 이 함수로 어떻게 대화가 될까요? 비결은 대본입니다. ‘유저: … / 비서: …’ 형식의 대본을 아주 많이 학습시키면, f는 ‘비서:’ 뒤에 비서다운 대답이 올 확률을 높게 계산하게 됩니다.

      유저: 너는 누구야?
      비서: 저는 비서예요. 무엇을 도와드릴까요?
      유저: 오늘 점심 뭐 먹지?
      비서: 따뜻한 국밥은 어떠세요?
      유저: 배가 아파요.
      비서: 언제부터 아프셨어요?
      이런 대본 수백만 개

      채팅 앱은 우리가 쓴 말을 이 대본 형식으로 감싸서 f에 넣고, f가 이어 쓴 부분만 말풍선으로 보여 줍니다. 아래에서 메시지를 보내 보고 오른쪽 칸을 보세요.

      실험 2 · 채팅 화면 뒤에서 벌어지는 일시뮬레이션
      채팅 앱 화면유저가 보는 모습
      모델이 실제로 받는 글x · 입력 y · f가 이어 쓴 말

      대화가 이어질수록 앞의 대본이 모두 x에 다시 들어갑니다. 대화가 길어지면 입력도 길어지는 이유입니다.

      4

      기본 LLM과 지시 학습을 거친 LLM

      글만 잔뜩 읽힌 모델(기본 LLM)은 대화를 모릅니다. ‘너는 누구야?’를 넣으면 소설처럼 글을 이어 씁니다. 여기에 대본 형식의 질문과 답변으로 추가 학습(인스트럭션 파인튜닝)을 하면, 같은 f가 비서처럼 답하는 쪽으로 확률이 바뀝니다. ChatGPT와 gpt-oss처럼 우리가 쓰는 모델은 모두 이 단계를 거쳤습니다.

      실험 3 · 같은 말, 다른 f시뮬레이션
      기본 LLM글만 읽힌 모델
      지시 학습 LLM대본으로 추가 학습한 모델

      회색은 x, 초록은 f가 이어 쓴 y입니다. 기본 LLM은 글을 그대로 이어 쓰고, 지시 학습 LLM은 앱이 감싼 대본에서 비서의 대사를 이어 씁니다.

      모델이 만들어지는 과정

      1 · PRETRAINING

      사전학습

      웹, 책, 논문 등 수조 토큰의 글로 다음 토큰 맞히기를 반복합니다. 지식과 언어 능력이 여기서 생깁니다.

      비유교과서와 논문을 통째로 읽은 의대생. 아는 건 많지만 진료하는 법은 모릅니다.
      2 · SFT

      지시 학습

      질문과 모범답안 쌍으로 대화하고 지시를 따르는 법을 배웁니다.

      비유선배가 쓴 모범 차트를 보며 배우는 인턴.
      3 · RLHF · RL

      강화학습

      사람의 선호나 정답 여부로 보상을 주며 행동을 다듬습니다. 추론 모델은 문제를 푸는 과정 자체를 여기서 강화합니다.

      비유교수 피드백과 환자 결과로 다듬어지는 전공의.
      4 · 예선의 우리

      가중치는 고정

      우리가 바꿀 수 있는 건 모델에게 주는 입력(프롬프트)과, 모델을 언제 몇 번 어떻게 부를지 정하는 바깥 설계뿐입니다.

      비유전공의를 재교육할 수는 없으니, 좋은 체크리스트와 진료 프로토콜을 쥐여 주는 것.
      0-2 · 2교시

      환각: 그럴듯하지만 사실이 아닌 답

      f는 학습한 글에서 그럴듯한 다음 말을 고를 뿐, 사실을 확인하지 않습니다. 이 성질이 문제가 되는 순간을 직접 보겠습니다.

      1

      “지금 몇 시야?”를 넣으면

      ‘유저: 지금 몇 시야?’를 x로 넣으면 y는 무엇일까요? 함수 안에는 시계가 없습니다. 학습한 글에서 ‘몇 시야?’ 다음에 ‘9시 40분’이라는 대답이 많았다면, f는 지금 실제 시각과 상관없이 ‘9시 40분’을 가장 높은 확률로 냅니다. 이렇게 실제 답과 무관하게, 학습된 패턴에서 그럴듯한 답을 만들어 내는 현상을 환각(hallucination)이라고 합니다.

      실험 4 · 몇 번을 물어도 같은 답시뮬레이션 · 확률은 설명용 예시
      실제 세계
      --:--:--
      이 기기의 시계
      f가 계산한 다음 말의 확률

          ‘f(x) 다시 실행’을 여러 번 눌러 보세요. 실제 시각은 계속 바뀌지만 모델의 답은 그대로입니다. 두 번째 예시는 하지 않은 검사의 수치를 지어내는 경우로, 우리 대회에서 가장 위험한 환각입니다.

          GPT-3.5 시절

          초창기 GPT-3.5 서비스는 환각이 매우 심했습니다. 잘 다루는 사람이 아니면 그럴듯하지만 틀린 답을 그대로 믿기 쉬웠고, 그래서 쓸모없다는 평가도 많았습니다.

          2

          해결책: 모델이 모르는 것은 도구에게 맡깁니다

          이 문제를 줄이려고 나온 방법이 도구(tool)입니다. 시스템 프롬프트에 ‘시간 질문에는 네 지식으로 답하지 말고 get_time()을 호출해’라고 적어 둡니다. 그러면 f는 답 대신 ‘get_time()’이라는 글을 출력합니다. 우리 코드가 그 글을 보고 실제 시계를 읽은 뒤, 결과를 ‘툴’ 역할의 메시지로 x에 붙여 다시 넣습니다. 이제 x 안에 진짜 시각이 들어 있으니, f는 그 시각을 옮겨 적는 답을 가장 그럴듯하다고 계산합니다.

          실험 5 · 도구 없이 vs 도구 사용시뮬레이션 · 시각은 이 기기 기준
          ① 도구 없이f의 기억만으로 답함
          ② 도구 사용

          1LLM답 대신 도구 호출 글을 출력
          get_time()
          2우리 코드그 글을 보고 실제로 실행
          시계를 읽음
          3x에 추가결과를 ‘툴’ 역할로 입력
          system time: 22:00
          4LLM결과를 보고 답
          “지금 시각은 밤 10시예요.”
          대회와 연결

          이번 대회의 ASK, EXAM, TEST가 모두 이런 도구입니다. 에이전트가 ‘TEST: CBC’라고 출력하면 대회 서버가 결과를 돌려줍니다. 하지 않은 검사의 결과를 지어내면 곧바로 안전성 문제가 됩니다.

          0-3 · 3교시

          RAG: 모르는 의료 정보는 서랍에서 꺼내 옵니다

          도구가 시계를 대신 읽어 주듯, 모델이 모르는 의료 정보는 미리 정리해 둔 의료 정보 서랍(DB)에서 찾아와 넣어 줍니다. 이것을 RAG(검색 증강 생성)라고 부릅니다. 기억만으로 푸는 시험을 오픈북 시험으로 바꾸는 셈입니다.

          1

          모델은 우리 팀 문서를 본 적이 없습니다

          gpt-oss-20b는 2024년 6월까지의 글로 학습했습니다. 우리 팀이 2026년에 쓸 체크리스트는 당연히 모릅니다. 그렇다고 모델을 다시 학습시킬 필요는 없습니다. 질문이 들어오면 코드가 서랍에서 관련 문서를 찾아 ‘참고 자료’로 x에 붙입니다. f는 x 안에 있는 자료를 따라 쓰는 답을 가장 그럴듯하다고 계산하므로, 자료에 근거해 답합니다.

          실험 6 · 의료 정보 서랍에서 찾아 답하기시뮬레이션 · 문서 내용은 예시
          의료 정보 서랍우리 팀 문서 (예시)
          1 · 찾기
          2 · 찾은 자료를 x에 붙이기
          3 · 답

          RAG를 끄고 같은 질문을 해 보세요. 서랍 없이 기억만으로 답하면 중요한 항목이 빠집니다. 질문을 직접 써도 됩니다. 예: 두통 환자에서 위험 신호는?

          2

          실제로는 더 정교하지만 원리는 같습니다

          실제 검색은 글자가 달라도 뜻이 비슷한 문서를 찾아내는 등 더 정교한 방법을 씁니다. 그래도 원리는 세 단계입니다. 찾아오고, x에 붙이고, 그 자료로 답하게 합니다. 이번 대회는 제출 용량이 50MB라서 서랍에 무엇을 얼마나 압축해 넣을지가 중요합니다. 그 내용을 쓰는 사람이 의사 팀원입니다.

          세 교시를 합치면 Doctor Agent가 됩니다

          1교시 · 함수gpt-oss-20b

          다음 말을 확률로 고르는 f(x)

          1교시 · 대본harmony 형식

          system, developer, user, assistant, tool 역할로 x를 짭니다

          2교시 · 도구ASK · EXAM · TEST · DIAGNOSE

          에이전트가 호출하고 대회 서버가 실행합니다

          3교시 · RAG우리 팀 의료 정보 서랍

          주호소별 체크리스트, 질환–소견 표. 의사 팀원이 씁니다

          그리고 · 진행자코드(상태 머신)

          언제 무엇을 부를지 정합니다

          이 구조가 대회에서 어떻게 돌아가는지는 A3 게임의 규칙에서, 우리 팀의 구체적인 설계는 C2 설계 방향에서 이어집니다.

          PART A대회 이해무엇을, 어떤 규칙으로 겨루는가
          A1 · 한눈에

          대회 한눈에

          주최·주관
          분당서울대학교병원 의료인공지능센터 · 엘리스(elice)
          후원
          경기도경제과학진흥원 · 정보통신기획평가원 · 한국보건산업진흥원
          과제
          가상 환자를 진료하는 Doctor Agent 개발코드를 제출하면 대회 서버에서 비공개 증례로 실행
          예선 모델
          openai/gpt-oss-20b 고정파인튜닝 금지 · 모든 팀이 같은 모델 사용
          상호작용
          증례당 최대 60턴문진 ASK · 진찰 EXAM · 검사 TEST · 진단 DIAGNOSE
          평가
          진단 정확도 · 정보 획득 효율성 · 임상적 안전성세부 지표와 가중치는 예선 전 공개
          참가
          개인 또는 최대 4인 팀 · 100팀 모집전공 제한 없음 · 포스터에는 “내국인 누구나”로 표기
          문의
          aisnubh@gmail.com신청 관련 문의에는 팀명을 함께 적도록 안내

          일정

          예선은 11일이고 하루에 한 번만 제출할 수 있습니다. 서버 채점 기회가 많아야 11번이라, 예선 전에 로컬 평가 환경을 갖춰 두는 것이 중요합니다. 제출 마감 시각, 본선 진출 발표일, 시상식 장소는 추후 공지됩니다.

          시상과 혜택

          대상 · 1팀
          250만원
          우수상 · 1팀
          150만원
          장려상 · 2팀
          50만원씩
          분당서울대병원 연구진과 논문화 기회, 의료인공지능센터 인턴십 연계총상금 500만원. 특전의 대상과 조건은 별도 안내이며, 논문 게재나 인턴십 선발을 보장하지는 않습니다.
          A2 · 대회의 계보

          예측에서 생성으로, 이제 에이전트로

          분당서울대병원 의료인공지능센터는 2023년부터 해마다 가을에 의료 AI 데이터톤을 열었습니다. N.O.V.A.는 네 번째 대회이고, 이 이름을 쓰는 첫 대회입니다. 대회 형식은 거의 그대로이고, AI에게 맡기는 일만 해마다 커졌습니다.

          2023
          예측
          COVID-19 중환자 임상 예측 데이터톤
          과제
          예선은 MIMIC-IV로 공정한 중환자 예후 모델. 본선은 분당서울대병원 COVID-19 중환자 사망 예측.
          AI의 출력
          환자별 위험도 점수
          평가
          정확도와 공정성 지표(Disparate Impact, Equal Opportunity)
          함께한 곳
          호흡기내과, SNU AI.MED. 후원 AWS, KHIDI, IITP
          근거 · 센터 공식 연혁, 대회 포스터
          2024
          예측
          급성신손상(AKI) 환자 예측 데이터톤
          과제
          예선은 MIMIC-IV, 본선은 분당서울대병원 입원 자료로 AKI 발생 예측.
          AI의 출력
          AKI 발생 확률
          평가
          심사위원단이 모델 성능과 공정성 지표를 평가
          기록
          예선 69팀(참가자 기록). 대상은 KAIST 전기및전자공학부 팀
          근거 · 공식 연혁, 포스터, 보도, 참가팀 기록
          2025
          생성
          M.A.R.S. 의무기록 생성 데이터톤
          과제
          예선은 MIMIC-IV-Note로 입원 경과 요약, 영상 판독 소견, ICD-10 코드 생성. 본선은 실제 입원 자료로 퇴원기록지 자동 생성.
          모델 규칙
          예선은 프롬프팅만 허용. EXAONE-3.5-7.8B 또는 Llama-3.1-8B 고정, 온도 0. 본선은 RAG·파인튜닝 자유.
          평가
          자동 지표와 gpt-oss-120b 채점 60점, 정성 평가 40점. 공정성 포함
          기록
          96팀 참가, 10팀 본선 진출. 우수상은 KAIST 경영대학 팀
          근거 · 공식 연혁, 포스터, 주최 측 노트북, 참가팀 기록
          2026
          에이전트
          N.O.V.A. 대화형 의료 진단 AI 에이전트 대회
          과제
          가상 환자에게 묻고, 진찰하고, 검사해서 진단하는 Doctor Agent. 증례당 최대 60턴.
          모델 규칙
          예선은 gpt-oss-20b 고정, 파인튜닝 금지. 본선은 VRAM 20GB 이하에서 자유.
          평가
          정확도, 효율성, 안전성 자동 채점. 채점에 GPT 모델 사용
          함께한 곳
          엘리스가 처음으로 공동 주최. 후원 GBSA, IITP, KHIDI
          근거 · 대회 공식 사이트, 포스터
          2023–2024 · 예측
          숫자 하나

          정리된 표 데이터를 받아 위험도를 계산합니다. 필요한 입력은 처음부터 다 주어집니다.

          2025 · 생성
          문서 한 장

          흩어진 기록을 읽고 퇴원기록지를 씁니다. 입력은 여전히 처음부터 다 주어집니다.

          2026 · 에이전트
          진료 과정 전체

          처음엔 입력이 거의 없습니다. 무엇을 묻고 무엇을 검사할지, 언제 멈출지를 에이전트가 정합니다.

          해마다 그대로인 것

          • 예선은 고정 조건, 본선은 자유. M.A.R.S. 예선도 지정 모델 두 개 중 하나만, 온도 0, 분당 10회 요청 제한이었습니다. N.O.V.A.의 gpt-oss-20b 고정은 같은 구조입니다.
          • 공정성 평가. 2023–2025 세 대회 모두 성별·연령대 같은 집단 사이의 성능 차이를 채점했습니다. N.O.V.A. 공지에는 아직 없지만 미리 점검해 둡니다.
          • LLM 채점. M.A.R.S.는 gpt-oss-120b로 문서 품질을 채점했습니다. N.O.V.A. 규정에는 “채점에 사용되는 GPT 모델”이라고만 적혀 있습니다.
          • 본선은 발표가 있는 정성 평가. M.A.R.S. 본선은 문서 품질 70점, 전략 설계 30점이었다는 참가팀 기록이 있습니다.
          • 같은 틀. 총상금 500만원(250·150·50×2), 최대 4인 팀, 논문화·인턴십 특전, 포스터의 ‘내국인’ 조건이 해마다 같습니다.

          지난 참가팀의 기록에서 배울 것

          규칙 우선, LLM은 최소로

          M.A.R.S. 본선 6위 팀은 날짜·수치·코드를 규칙으로 뽑고, LLM에는 서술만 맡겼습니다.

          규칙도 과하면 해롭습니다

          같은 팀이 ICD 프롬프트를 단순화하자 F1이 0.62에서 0.92로 올랐고, 규칙을 더 넣자 0.61로 떨어졌습니다.

          규정은 대회 중에도 바뀝니다

          2024년에는 규칙이 Slack 질의응답으로 확정되거나 중간에 추가됐다는 참가자 기록이 있습니다. 공지를 매일 보고, 설정은 바꾸기 쉽게 둡니다.

          본선은 잠긴 환경이었습니다

          2024–2025 본선은 데이터 반출 금지, 한 번에 한 명만 실행, 리더보드 없음. 2025 우수상 팀은 약 두 달을 준비했다고 적었습니다.

          참가팀 기록은 각 팀의 GitHub와 블로그에 올라온 자체 기록입니다. 센터는 2022년 가상 환자와 진료를 연습하는 도구로 외부 경진대회(성균관대·네이버)에서 2등을 한 적도 있습니다(CIO Korea 보도). 가상 환자는 센터가 전부터 다뤄 온 주제입니다.

          A3 · 게임의 규칙

          한 증례는 이렇게 진행됩니다

          에이전트는 환자의 기본 정보와 초기 증상만 받고 시작합니다. 나머지 정보는 서버에 숨겨져 있고, 에이전트가 묻거나 검사한 만큼만 드러납니다.

          우리가 만드는 것
          Doctor Agent
          • run.py 추론 코드Python
          • 상태 관리 · 규칙 · 후처리CPU
          • gpt-oss-20b 호출서버 GPU
          • 검색 인덱스 · 소형 임베딩CPU · 선택
          ASK→ 문진 질문 “통증이 어디서 시작됐나요?”← 환자의 답변
          EXAM→ 신체진찰 항목 “복부 진찰”← 진찰 소견
          TEST→ 검사·영상검사 “CBC, 복부 CT”← 검사 결과
          DIAGNOSE→ 최종 진단 제출■ 증례 종료, 채점
          대회 서버
          가상 환자 환경
          • 전체 증례 정보는 비공개
          • 허용된 인터페이스로 묻는 만큼만 공개
          • 증례당 최대 60턴, 행동은 반복 가능
          • 채점 증례 원문과 실행 산출물은 비공개
          SCORING자동 채점: 진단 정확도 · 정보 획득 효율성 · 임상적 안전성채점에 GPT 모델 사용 (API 크레딧 안내 기준)

          평가 기준 세 가지

          예선 순위는 대회 서버의 자동 채점 점수만으로 정합니다. 세부 지표와 가중치는 예선 시작 전에 공개됩니다.

          ACCURACY진단 정확도최종 진단이 얼마나 정확한가채점 모델이 오해하지 않도록 표준 진단명과 적절한 구체성으로 제출합니다.
          EFFICIENCY정보 획득 효율성필요한 정보를 효율적으로 얻었는가감별에 도움이 되는 질문부터 하고, 순위를 바꾸지 못하는 질문과 중복 검사는 줄입니다.
          SAFETY임상적 안전성적절한 질문과 검사를 선택했는가놓치면 위험한 질환을 먼저 확인하고, 근거 없는 침습적·고비용 검사는 피합니다.
          긴장 관계

          정확도를 올리려면 더 묻고 더 검사하고 싶어지고, 효율성은 그 반대를 요구합니다. 가중치가 공개되면 턴 예산부터 다시 정합니다.

          숫자로 보는 제약

          60턴증례당 최대 상호작용
          1회/일예선 제출 한도. 11일간 최대 11회
          50MB제출 ZIP 최대 크기. 코드와 정적 자산만
          5만원개발용 API 크레딧. gpt-oss-20b와 채점용 GPT 호출
          20GB본선 제출 모델의 VRAM 한도

          예선과 본선의 차이

          항목예선 · 10.12–10.22본선 · 10.27–11.10
          모델openai/gpt-oss-20b 고정서버에 준비된 동일 모델 · 규정의 리비전 해시는 불일치(B3 참고)자유롭게 선택파인튜닝한 모델 포함
          파인튜닝금지LoRA·QLoRA 등 어댑터 학습, 가중치·어댑터 로드 포함허용
          하드웨어서버 GPU는 고정 LLM 전용추가 구성 요소는 CPU·RAM에서 제한 시간 안에VRAM 20GB 이하에서 로드·실행
          제출물run.py + requirements.txt ZIP최대 50MB · 추론 코드와 정적 자산(검색 인덱스 등)모델 · 코드 + 발표 자료(PPT)
          평가서버 자동 채점 점수만본선 진출팀에 별도 안내포스터 표기: 심사위원단의 정량 + 정성 평가
          제출 횟수1일 최대 1회별도 안내

          허용과 금지

          허용

          • 대회 제공 샘플 증례를 학습·검증·검색·후처리 등 어떤 용도로든 활용
          • 자가 라벨링. 수작업, 규칙, 모델 기반 모두 가능
          • 라벨 생성과 데이터 가공에 외부 LLM(상용 API 포함) 사용
          • 연구 출판에 쓸 수 있는 라이선스의 외부 데이터셋·의학 자료
          • requirements.txt로 공개 오픈소스 라이브러리 설치
          • 모델 출력의 후처리와 규칙 기반 보정

          금지

          • 고정 LLM의 파인튜닝, 가중치·어댑터의 제출과 로드
          • 제출한 추론 코드에서 외부 LLM·외부 API 호출
          • 라이선스가 불분명하거나 연구 출판 이용이 제한된 자료
          • 비식별 증례를 외부 자료와 대조해 복원하려는 시도
          • 다른 증례의 정보·예측값·통계로 예측을 만들거나 보정
          • 비공개 평가 증례로 추가 학습, 튜닝, 의사 라벨링
          필수 요건

          에이전트는 증례마다 해당 증례 정보를 담은 프롬프트로 고정 LLM을 한 번 이상 정상 호출해야 합니다. 규칙만으로 답하는 제출물은 무효 처리될 수 있습니다.

          재현성

          수상팀은 대회 제공 자료와 제출 자료만으로 결과를 재현할 수 있어야 합니다. 외부 LLM으로 만든 라벨은 생성 코드, 프롬프트, 모델 버전과 라벨 데이터를 함께 냅니다. 예선 뒤 본선 진출 대상팀은 재현 코드와 실행 방법, 사용 요소의 출처·라이선스, 팀원 정보(성명·생년월일·성별·현재 소속)를 이메일로 제출합니다.

          A4 · 예시 증례

          예시 증례로 한 판 따라가기

          이해를 돕기 위해 만든 가상의 증례입니다. 실제 대회 데이터가 아닙니다. 에이전트가 턴마다 무엇을 하고, 속으로 감별진단 순위를 어떻게 바꾸는지 보여줍니다.

          초기 정보38세 남성 · 이틀 전부터 복통처음에 공개되는 정보는 이것뿐입니다
          1. T01ASK배가 처음 어디서부터 아팠고, 지금은 어디가 제일 아프세요?처음엔 명치 쪽이 더부룩하게 아팠는데, 어제부터는 오른쪽 아랫배가 아파요.
          2. T02ASK입맛은 어떠세요? 메스껍거나 토하신 적이 있나요?입맛이 없고, 어제 한 번 토했어요.
          3. T03ASK열이 나거나 몸이 으슬으슬하셨나요?어젯밤에 좀 으슬으슬했어요.
          4. T04ASK배 전체가 딱딱하게 아프거나, 방귀나 대변이 전혀 안 나오나요? 위험 감별그렇진 않아요. 어제도 대변은 봤어요.
          5. T05ASK소변 볼 때 아프거나 피가 섞이나요? 옆구리나 등 쪽으로 뻗치는 통증은요? 위험 감별아니요, 그런 건 없어요.
          6. T06EXAM활력징후체온 37.9 °C · 맥박 96회/분 · 혈압 128/78 mmHg · 호흡 18회/분
          7. T07EXAM복부 진찰우하복부(McBurney 점) 압통, 반발통 양성, Rovsing 징후 양성
          8. T08TESTCBC, CRPWBC 13.8 ×10³/µL (호중구 82%) · CRP 6.1 mg/dL
          9. T09TEST소변검사적혈구·백혈구 음성, 특이 소견 없음
          10. T10TEST복부·골반 CT (조영증강)충수 직경 11 mm, 주변 지방 침윤. 천공·농양 소견 없음
          11. T11DIAGNOSE급성 충수염 (acute appendicitis)증례 종료, 채점
          11 / 60턴문진 5진찰 2검사 3진단 1남은 턴 49

          에이전트 속의 감별진단 순위

          확률은 설명용 예시입니다. 실제로는 LLM의 판단과 임상 점수 규칙을 합쳐 계산합니다. 이 증례는 Alvarado 점수 10점 만점에 10점입니다(이동통 1, 식욕부진 1, 구역·구토 1, 우하복부 압통 2, 반발통 1, 발열 1, 백혈구 증가 2, 좌방이동 1). 의사 팀원이 이런 점수 체계를 알려주면 그대로 규칙이 됩니다.

          코드가 들고 있는 상태 (T05 시점)

          demographics
          38세 남성
          chief_complaint
          복통, 2일
          positives
          명치 → 우하복부 이동통, 식욕부진, 구토 1회, 오한
          negatives
          전복부 경직, 배변·가스 정지, 배뇨통·혈뇨, 옆구리 방사통
          red_flags
          복막염 확인 · 장폐색 확인 · 요로결석 확인
          ddx
          급성 충수염 .65 · 급성 위장염 .12 · 우측 게실염 .08
          asked
          통증 위치·이동, 식욕·구토, 발열, 복막 자극·장폐색, 요로 증상
          turns_used
          5 / 60

          LLM에게는 대화 전문 대신 이 요약을 넘깁니다. 이미 물은 항목을 코드가 기억하므로 같은 질문을 반복하지 않습니다.

          이 한 판에서 본 세 가지 평가 축

          ACCURACY표준 진단명 “급성 충수염(acute appendicitis)”으로 제출했습니다. 채점 모델이 다른 병으로 읽을 여지를 줄입니다.
          EFFICIENCY11턴 만에 끝냈습니다. 질문마다 감별 순위를 움직였는지가 기준입니다. 순위를 바꾸지 못하는 질문은 비용입니다.
          SAFETYT04·T05에서 복막염, 장폐색, 요로결석처럼 놓치면 위험한 감별을 먼저 확인했습니다. 조영 CT는 소견으로 근거를 쌓은 뒤에 요청했습니다.
          PART BLLM 더 알기용어, 요즘 모델, 우리 모델 gpt-oss-20b
          B1 · 핵심 용어

          개발 회의에서 나올 용어 18개

          각 용어가 이번 대회에서 왜 중요한지도 함께 적었습니다. PART 0에서 다룬 개념도 여기서 다시 정리했습니다. 모델 자체, 모델의 성질, 모델을 쓰는 법의 세 묶음입니다.

          모델 자체

          토큰 token

          모델이 읽고 쓰는 최소 단위로, 단어보다 작은 글자 조각입니다. 한국어는 같은 내용을 쓰는 데 영어보다 토큰이 더 드는 편입니다.

          호출 속도와 컨텍스트 사용량의 단위입니다. 60턴 대화가 쌓이면 토큰도 쌓입니다.

          파라미터 parameter

          학습으로 정해지는 모델 내부의 숫자(가중치)입니다. 많을수록 대체로 아는 것이 많지만 무겁고 느립니다.

          gpt-oss-20b는 약 210억 개. 최상위 모델보다 의학 지식이 얕아서, 부족한 지식은 바깥에서 공급합니다.

          MoE mixture of experts

          여러 ‘전문가’ 하위 신경망 가운데 몇 개만 골라 계산하는 구조입니다. 큰 모델의 지식을 작은 계산량으로 씁니다.

          gpt-oss-20b는 토큰마다 32개 전문가 중 4개만 씁니다. 그래서 체급에 비해 빠릅니다.

          양자화 quantization

          숫자의 정밀도를 낮춰 모델을 가볍게 만드는 기술입니다. 용량과 속도를 얻고 정확도를 조금 내줍니다.

          gpt-oss-20b는 4비트급 MXFP4 형식이라 16GB 메모리에서 돌아갑니다.

          오픈웨이트 vs API open-weight

          가중치를 공개해 누구나 내려받아 돌리는 모델과, 회사 서버를 통해서만 쓰는 모델(GPT, Claude, Gemini 등)이 있습니다.

          gpt-oss는 오픈웨이트입니다. 제출 코드 안에서는 외부 API를 쓸 수 없습니다.

          파인튜닝 fine-tuning

          특정 데이터로 가중치를 추가 학습시키는 것입니다. 프롬프트가 지시라면 파인튜닝은 재교육입니다.

          예선은 금지, 본선은 VRAM 20GB 이하 모델이면 허용됩니다.

          모델의 성질

          컨텍스트 윈도 context window

          모델이 한 번에 볼 수 있는 입력과 출력의 총길이로, 모델의 작업 기억입니다.

          gpt-oss-20b는 약 13만 토큰까지 봅니다. 그래도 길어질수록 앞 내용을 흐리게 다루므로 대화 전문 대신 정리된 상태를 넣습니다.

          지식 컷오프 knowledge cutoff

          학습 데이터가 끝나는 시점입니다. 그 이후의 지식은 모릅니다.

          gpt-oss의 지식은 2024년 6월까지입니다. 그 뒤에 바뀐 가이드라인은 검색 자료로 보충합니다.

          환각 hallucination

          사실이 아닌 내용을 그럴듯하고 자신 있게 만들어내는 현상입니다. 작은 모델일수록 사실 지식을 묻는 문제에서 잦습니다.

          하지 않은 검사의 결과를 지어내거나 근거 없이 진단을 확신하는 일을 규칙으로 막습니다.

          온도 · 샘플링 temperature

          다음 토큰을 확률에 따라 뽑기 때문에 같은 질문에도 답이 조금씩 달라집니다. 온도가 높을수록 다양해집니다.

          한 번의 답을 믿지 않고, 여러 번 생성해 다수결로 안정화합니다.

          추론 모델 reasoning model

          답하기 전에 속으로 긴 ‘생각’을 먼저 쓰는 모델입니다. 생각이 길수록 어려운 문제에 강해지지만 느려집니다.

          gpt-oss는 생각의 양을 low · medium · high로 조절합니다. 단계마다 다르게 씁니다.

          프롬프트 민감도 prompt sensitivity

          같은 뜻이라도 표현, 순서, 예시에 따라 답이 달라지는 성질입니다. 작은 모델일수록 심합니다.

          프롬프트를 버전으로 관리하고, 바꿀 때마다 같은 평가셋으로 비교합니다.

          모델을 쓰는 법

          프롬프트 prompt

          모델에게 주는 지시문과 자료입니다. 역할, 규칙, 출력 형식, 예시를 담습니다.

          의사 팀원의 임상 지식이 가장 직접 들어가는 곳입니다. 평소 쓰는 문장으로 주면 됩니다.

          구조화 출력 structured output

          자유로운 문장 대신 JSON 같은 정해진 형식으로 답하게 하는 것입니다.

          코드가 답을 읽고 다음 행동을 정하려면 필수입니다. 형식이 깨지면 검증 후 다시 요청합니다.

          RAG · 임베딩 retrieval

          관련 자료를 먼저 찾아 프롬프트에 붙여 주는 방식입니다(오픈북 시험). 임베딩은 문장을 의미 좌표로 바꿔 비슷한 자료를 찾는 도구입니다.

          ZIP 50MB, CPU만 쓸 수 있습니다. 크고 무거운 검색보다 작고 압축된 지식이 유리합니다.

          도구 호출 · 에이전트 tool use

          모델이 ‘검색’, ‘검사 오더’ 같은 행동을 고르고, 결과를 보고 다음 행동을 정하는 반복 구조입니다.

          ASK · EXAM · TEST · DIAGNOSE가 곧 도구입니다.

          워크플로 vs 에이전트 workflow

          워크플로는 코드가 정한 경로로 LLM을 부르고, 에이전트는 LLM이 다음 단계를 스스로 정합니다. Anthropic이 정리한 구분입니다.

          작은 모델에는 코드가 흐름을 쥐는 워크플로가 안정적입니다. C2에서 자세히 다룹니다.

          LLM 채점자 LLM-as-a-judge

          LLM이 다른 모델의 답을 평가하는 방식입니다. 사람보다 빠르지만 표현 차이에 흔들릴 수 있습니다.

          이번 채점에 GPT 모델이 쓰입니다. 진단명은 채점 모델이 헷갈리지 않는 표준 용어로 냅니다.
          B2 · 요즘 모델

          2026년 가을의 모델 지형

          gpt-oss-20b는 2025년 8월에 나온 모델입니다. 그 뒤 1년 동안 최상위 모델은 여러 세대를 더 나아갔고, 2026년 9월 한 달에만 최상위급 모델이 아홉 개 넘게 나왔습니다. 우리 모델이 어디쯤 있는지 알아야 무엇을 기대하고 무엇을 보완할지 정할 수 있습니다.

          닫힌 프런티어 모델

          회사 서버를 통해서만 쓰는 최상위 모델

          • GPT-6 Astra · GPT-6.1 SolOpenAI · 2026.09
            Astra가 최상위, 9월 29일에 나온 6.1 Sol이 가장 최신입니다. 추론, 코딩, 컴퓨터 조작이 강점입니다.
          • Claude Fable 5.1 · Opus 5.5 · Sonnet 5.5Anthropic · 2026.09
            Fable은 Opus 위의 최상위 등급으로 몇 시간짜리 에이전트 작업을 겨냥합니다. 기본 추천은 Opus 5.5입니다.
          • Gemini 3.1 Pro · 3.8 FlashGoogle · 2026.02 / 09
            이미지, 영상, 음성, PDF를 함께 다루는 멀티모달이 강점입니다. Gemini 4가 예고돼 있습니다.
          • Grok 4.7xAI · 2026.09
            50만 토큰 컨텍스트, 추론 강도 4단계. Grok 5는 아직 나오지 않았습니다.

          오픈웨이트 모델

          가중치를 공개해 직접 내려받아 돌리는 모델

          • Kimi K3Moonshot AI · 2026.07
            총 2.8T 파라미터 중 토큰당 104B만 쓰는 MoE. 공개된 모델 가운데 가장 큽니다.
          • Qwen3.8Alibaba · 2026.08
            2.4T MoE와 27B 밀집 모델. 27B는 Apache 2.0입니다.
          • DeepSeek-V4.1-FlashDeepSeek · 2026.09
            100만 토큰 컨텍스트를 싸게 쓰도록 설계. MIT 라이선스.
          • Gemma 4Google · 2026.04
            작은 크기와 기기 내 실행에 강한 계열(최대 31B). 본선 후보군으로 볼 만합니다.
          • gpt-oss-20b · 120bOpenAI · 2025.08 · 우리 모델
            16GB 메모리에서 돌아가는 20B급. 2026년 9월 현재 후속 모델은 없습니다.

          의료와 한국

          의료 특화 모델, 현장 도입, 국내 동향

          • MedGemma 1.5Google · 2026.01
            의료 특화 오픈 모델(4B). CT·MRI, 병리 슬라이드, EHR 정보 추출까지 다룹니다.
          • AMIE 전향 연구Google · 2026.03
            BIDMC 1차 진료 환자 100명. 최종 진단이 AMIE의 감별 목록에 든 비율 90%, 상위 3위 안 75%.
          • 현장용 제품2026.01–04
            ChatGPT Health, ChatGPT for Clinicians, Claude for Healthcare가 출시됐습니다. 미국 의사의 81%가 업무에 AI를 씁니다(AMA 조사).
          • 한국 독자 AI 파운데이션 모델과기정통부 · 2026.08
            2차 평가에서 SKT A.X K2, 업스테이지 Solar Open 2, LG K-EXAONE 2.0이 통과했습니다. 연말에 두 팀을 고릅니다.
          • 객관식 의학 시험은 포화MedQA · KMLE
            MedQA는 최신 모델 대부분이 95%를 넘고, 국시(KMLE)도 97–99%라는 자체 발표가 나옵니다.

          2025–2026년의 흐름 여섯 가지

          우리 모델의 위치

          gpt-oss-20b는 2026년 기준으로 작고 1년 넘게 된 모델입니다. 추론은 체급 이상으로 하지만 사실 지식과 긴 자율 작업은 약합니다. 최상위 모델에서 통하는 방식, 곧 긴 에이전트 루프를 돌리거나 모델의 지식에 기대는 방식을 그대로 가져오면 안 되는 이유입니다.

          B3 · 우리 모델

          gpt-oss-20b는 어떤 모델인가

          OpenAI가 2025년 8월 5일 공개한 오픈웨이트 추론 모델입니다. GPT-2 이후 OpenAI가 처음 공개한 언어모델 가중치이고, 라이선스는 Apache 2.0입니다. 수학과 코딩에서는 체급을 크게 넘는 성적을 내지만, 지식을 묻는 문제에서는 작은 체급이 그대로 드러납니다.

          공개
          2025.08.05 · Apache 2.0
          파라미터
          총 20.9B · 토큰당 활성 3.6B
          구조
          MoE 트랜스포머 24층. 층마다 전문가 32개 중 4개 사용
          컨텍스트
          131,072 토큰
          용량
          MoE 가중치를 MXFP4(파라미터당 4.25비트)로 저장. 체크포인트 12.8GiB, 16GB 메모리에서 실행
          학습 데이터
          텍스트 전용. STEM, 코딩, 일반 지식 중심. 지식 컷오프 2024년 6월
          도구 학습
          웹 브라우징, 파이썬 실행, 개발자가 정의한 함수 호출
          대회 리비전
          규정에는 4d7ae498…로 적혀 있지만 gpt-oss-20b 저장소에는 없는 해시입니다. 아래 경고를 보세요.
          토큰 하나를 처리할 때 한 층의 전문가 32개
          20.9B전체 파라미터
          3.6B토큰당 계산
          4/32활성 전문가

          라우터가 토큰마다 전문가 4개를 고릅니다. 계산은 가볍지만 모든 전문가가 메모리에 올라가 있어야 하므로, 필요한 메모리는 전체 크기를 따릅니다. 비유하면 분과가 많은 병원에서 환자 한 명은 관련 분과 몇 곳만 협진하는 구조입니다.

          리비전 불일치

          규정의 해시 4d7ae4984b7db7de8f8457170b3f1a419ee76d52를 Hugging Face에서 openai/gpt-oss-20b로 조회하면 “Invalid rev id”가 나옵니다. 같은 해시는 google/gemma-4-26B-A4B-it의 최신 커밋(2026-07-20)과 정확히 일치합니다. gpt-oss-20b의 실제 최신 커밋은 6cee5e81ee83(2025-08-26)입니다.

          규정, FAQ, 평가 페이지가 모두 gpt-oss-20b라고 적고 있어 작성 중 실수일 가능성이 큽니다. 다만 두 모델은 프롬프트 형식이 완전히 다르므로, 서버의 모델과 리비전, 추론 엔진을 주최 측에 확인하기 전까지는 모델별 형식 코드를 한 곳에 분리해 둡니다.

          메시지 구조: harmony 형식

          gpt-oss는 harmony라는 전용 대화 형식으로 학습됐습니다. 메시지마다 역할이 있고 역할끼리 우선순위가 있습니다. 모델의 출력은 채널로 나뉩니다. 형식을 틀리게 쓰면 모델이 제 성능을 내지 못합니다.

          system우선순위 1

          모델 설정. 추론 강도(“Reasoning: high”), 지식 컷오프, 쓸 수 있는 도구를 적습니다.

          developer우선순위 2

          우리의 지시문. 역할, 규칙, 출력 형식(JSON), 함수 정의가 들어갑니다. 의사 팀원의 임상 규칙이 들어가는 자리입니다.

          user우선순위 3

          이번 단계의 입력. 증례 상태 요약과 이번에 판단할 질문 하나.

          assistant · analysis생각 채널

          답하기 전의 사고 과정. 사용자에게 보여주지 않는 채널입니다. 모델 카드는 다음 턴 입력에서 이전 턴의 생각을 지우라고 안내합니다.

          assistant · commentary도구 채널

          도구와 함수 호출이 나오는 채널.

          assistant · final답 채널

          최종 답. 우리는 여기서 JSON을 받아 코드로 검증합니다.

          API로 부를 때는 추론 강도를 프롬프트 문구가 아니라 reasoning_effort 같은 요청 파라미터로 지정하는 경우가 많습니다. vLLM은 우리가 보낸 system 메시지를 developer 메시지로 넣기 때문에 “Reasoning: high”를 직접 적어도 효과가 없습니다. 추론을 완전히 끌 수는 없습니다. 서버 구성은 참가자 가이드에서 확인합니다.

          추론 강도: 얼마나 오래 생각할지

          low

          짧게 생각하고 빠르게 답합니다.

          환자 답변에서 소견 추출, 검사명 정리
          medium

          중간 길이로 생각합니다.

          다음 행동 후보 만들기, 감별 갱신
          high

          가장 오래 생각합니다. AIME 수학 문제 하나에 생각 토큰을 평균 2만 개 넘게 씁니다.

          초기 감별, 반론, 최종 진단

          생각이 길수록 느려집니다. H100에서 초당 약 228토큰으로 계산하면 호출 한 번에 low는 약 7초, high는 1분 30초 안팎이 걸릴 수 있습니다(추정). 한 의료 벤치마크에서 high는 medium보다 계산량이 약 8배였습니다. 증례당 시간 제한이 공개되면 호출 예산부터 정합니다.

          생각을 늘리면 수학은 크게 오릅니다

          gpt-oss-20b 추론 강도별 정답률(%) · 모델 카드

          AIME 2025경시 수학, 도구 없음
          low37.1
          medium72.1
          high91.7
          GPQA Diamond대학원 수준 과학, 도구 없음
          low56.8
          medium66.0
          high71.5
          050100

          의료 대화 점수는 거의 그대로입니다

          gpt-oss-20b 추론 강도별 HealthBench 점수(%) · 모델 카드

          HealthBench현실적인 건강 대화
          low40.4
          medium41.8
          high42.5
          HealthBench Hard어려운 대화 부분집합
          low9.0
          medium12.9
          high10.8
          050100

          오래 생각해도 모델이 모르는 의학 지식은 생기지 않습니다. 그래서 추론 강도는 단계별로 아껴 쓰고, 점수를 올리는 투자는 입력의 질(요약, 체크리스트, 지식 표)에 합니다.

          성적표: 다른 모델과 비교

          HealthBench

          의사 262명이 만든 채점 기준표로 채점한 건강 대화 점수(%). gpt-oss는 high 기준

          o359.8
          gpt-oss-120b57.6
          o4-mini50.1
          gpt-oss-20b42.5
          o141.8
          o3-mini37.8
          GPT-4o32.0
          050100

          사실 지식: SimpleQA

          짧은 사실 질문 4,000개. 정답률은 높을수록, 환각률은 낮을수록 좋습니다(%)

          정답률
          o4-mini23.4
          gpt-oss-120b16.8
          gpt-oss-20b6.7
          환각률
          o4-mini75.0
          gpt-oss-120b78.2
          gpt-oss-20b91.4
          050100

          자율 에이전트 작업: Terminal-Bench 2.0

          터미널에서 긴 작업을 스스로 끝내는 과제 89개의 성공률(%). 모델과 에이전트 도구 조합별 · ICLR 2026 논문

          GPT-5.262.9
          Opus 4.557.8
          gpt-oss-120b18.7
          GPT-5-Nano7.9
          gpt-oss-20b3.1
          050100

          GPT-5.2는 Codex CLI, 나머지는 Terminus 2 에이전트 기준입니다. gpt-oss-20b는 평가된 모든 조합 가운데 가장 낮았습니다.

          틀이 잡힌 대화형 진단: AgentClinic

          Medmarks가 같은 하네스로 돌린 AgentClinic 대화형 진단(최대 20턴) 점수(%)

          Gemini-3-Pro85.9
          GPT-5.185.1
          Sonnet 4.585.1
          Qwen3-235B74.8
          gpt-oss-20b69.9
          gpt-oss-120b68.1
          Qwen3-30B62.8
          Qwen3-8B55.6
          050100

          gpt-oss는 high 기준. 최상위 모델과는 약 15점 차이지만, 120b와는 비슷합니다.

          같은 모델이 스스로 긴 작업을 끌고 가는 과제에서는 3.1%로 최하위이고, 정해진 틀 안에서 묻고 답하는 진단 과제에서는 69.9%를 냅니다. 우리가 코드로 틀을 짜려는 이유가 이 차이에 있습니다. 모델 카드 기준 HealthBench는 o1보다 조금 높고, 사실 질문에서는 시도한 답의 91.4%가 틀렸습니다.

          성질을 설계로 옮기면

          성질근거설계 대응
          강점추론이 체급 이상AIME 2025 91.7%(high). OpenAI 기준 o3-mini급감별, 반론, 최종 진단처럼 추론이 필요한 단계에 high를 씁니다.
          강점틀이 있으면 대화형 진단을 해냄Medmarks AgentClinic 69.9% (120b 68.1%)뼈대를 잘 짜면 경쟁할 만합니다. 예선의 승부처는 이 뼈대입니다.
          약점사실 지식이 얕음SimpleQA 정답률 6.7%, 환각률 91.4%질환–소견 표, 주호소별 체크리스트, 검색 자료로 지식을 공급합니다. 모델의 기억에 기대지 않습니다.
          약점생각을 늘려도 의료 점수는 제자리HealthBench 40.4 → 42.5 (low → high)추론 강도보다 입력의 질에 투자합니다.
          약점긴 자율 작업에 약함Terminal-Bench 2.0 3.1%로 전체 최하위. 최상위 조합은 57.8–62.9%상태 머신이 흐름을 쥐고, 모델에게는 짧은 판단만 맡깁니다.
          약점한국어는 한 단계 낮음MMLU 한국어판 77.6% (영어 MMLU 85.3%). vLLM에서 한국어 메시지일 때 도구 호출 인자가 깨지고 반복된 사례 보고내부 추론을 영어로 할지 샘플 증례로 비교합니다. 도구 호출 대신 JSON 출력을 씁니다.
          주의출력 형식 오류vLLM의 harmony 파싱 오류와 JSON 강제 관련 버그가 2026년에도 보고됨검증, 수선, 재시도. 그래도 실패하면 안전한 기본 행동으로 넘어갑니다.
          주의답이 매번 조금씩 다름권장 샘플링 온도 1.0여러 번 생성해 다수결과 일치도로 안정화합니다.
          참고검색은 걸러서 넣을 때만 효과한국어 의료 상담 연구(JMIR 2026): 기본 4.43/5, 단순 검색 4.46(유의하지 않음), 메타데이터로 거른 검색 4.51, 안전성 4.61로 비교 모델 중 최고주호소나 진료과로 먼저 거른 소량의 자료만 넣습니다.

          gpt-oss에 맞는 프롬프트 요령

          • 지시는 맨 앞 developer 메시지 하나에. 모델의 기본 정체성 문구는 그대로 두고, 역할과 규칙은 developer 메시지에 씁니다.
          • 추론 강도는 요청 파라미터로. 단계마다 다르게 지정합니다.
          • 생각을 억지로 늘리는 지시는 넣지 않습니다. 모델은 이미 생각 채널에서 추론합니다. 한국어 수능 수학 연구(KCSAT-ML)에서 추론을 더 길게 유도하는 설정을 쓰자 토큰은 약 2배로 늘고 정답률은 67.8%에서 58.4%로 떨어졌습니다.
          • JSON은 세 겹으로. 스키마를 developer 메시지에 넣고, 서버가 지원하면 스키마 제약 디코딩을 켜고, 코드에서 검증·수선·재시도합니다. 출력이 중간에 잘렸는지도 확인합니다.
          • 호출마다 새 요약을. 대화 이력을 쌓지 않고 증례 요약을 새로 넣습니다. 이전 턴의 생각은 넘기지 않습니다.
          PART C우리 팀선행 연구, 설계 방향, 역할 분담과 일정
          C1 · 선행 연구

          비슷한 문제를 먼저 푼 연구들

          N.O.V.A.의 구조는 마이크로소프트가 2025년 6월 발표한 SDBench와 가장 닮았습니다. 짧은 초기 정보, 묻고 검사하고 진단하는 행동, 요청한 만큼만 알려주는 환경, LLM 채점자가 모두 같습니다. 이 분야 연구에서 되풀이되는 결론부터 보고, 논문별 교훈으로 넘어갑니다.

          정보를 스스로 모으게 하면 정확도가 떨어집니다

          같은 증례를 전체 정보로 줄 때와 대화로 모으게 할 때의 진단 정확도(%)

          CRAFT-MD · GPT-4주관식 진단, 2,000증례
          전체 정보48.6
          대화로 수집26.4
          VivaBench · Gemini 2.5 Pro당시 최고 모델
          전체 정보69
          대화로 수집35
          MediQ · Llama-3-8B작은 모델
          전체 정보68.1
          초기 정보만52.0
          질문 허용33.0
          050100

          많이 묻는다고 좋아지지 않습니다

          AgentClinic-MedQA에서 GPT-4에게 허용한 상호작용 횟수별 진단 정확도(%)

          너무 적으면 정보가 모자라고, 너무 많으면 입력이 길어져 오히려 떨어졌습니다. SDBench의 의사 21명은 증례당 평균 질문 6.6개, 검사 7.2개를 썼습니다. AMIE 연구에서는 AI와 1차 진료의 모두 처음 약 10턴 안에 필요한 정보를 모았습니다.

          논문별로 가져올 것

          Microsoft AI · arXiv 2506.22405 · 2025.06

          SDBench와 MAI-DxO: 순차 진단의 기준점

          NEJM 임상병리 증례(CPC) 304개를 한 단계씩 진행하는 진단 문제로 바꿨습니다. 게이트키퍼 모델이 요청한 정보만 공개하고, 목록에 없는 검사는 증례와 맞는 결과를 만들어 돌려줍니다. 채점은 o3가 5점 척도로 하고 4점 이상을 정답으로 봅니다. MAI-DxO는 LLM 하나가 가상의 의사 다섯 명 역할을 나눠 맡는 오케스트레이터입니다.

          의사 21명 19.9% (도구 없이) · GPT-4o 49.3% · o3 단독 78.6% · MAI-DxO 81.9%, 앙상블 85.5%
          질문을 한 번에 하나씩 해도 정확도는 같고(83.9% 대 83.9%) 비용은 낮았습니다
          채점 기준이 우리에게 가장 중요합니다. 정답보다 더 구체적이면 5점, 핵심 질환은 맞고 부가 정보가 조금 틀리면 4점, 정답에 무관한 진단을 덧붙이면 3점(오답)입니다.
          arXiv 2607.15280 · 2026

          GraphDx: MAI-DxO를 오픈 모델로 재현

          제3자가 MAI-DxO를 다시 구현해 오픈 모델에 붙였더니 70B 모델에서 오히려 무너졌습니다. 같은 논문의 GraphDx는 증거 점수를 코드로 계산해 크게 올렸습니다.

          Llama-3.3-70B · MedQA 증례
          기본 65.7% → MAI-DxO 재현 50.3% → GraphDx 88.3%
          MAI-DxO 재현 시 턴 3.8 → 16.9, 유해 판정 12.5% → 42.3%
          긴 역할극 토론을 작은 모델에 그대로 옮기지 않습니다. 역할의 기능만 가져와 코드와 짧은 호출로 나눕니다.
          arXiv 2608.24570 · 2026.08

          EviDx: 8B 모델에 뼈대를 씌운 결과

          상태 추적, 검색, 종료 관문을 코드로 감싼 뼈대를 8B 모델에 적용했습니다. 관문은 불확실성이 충분히 낮고 증거가 충분히 모였을 때만 진단을 허락합니다.

          Qwen3-8B · JAMA 증례
          객관식 18% → 44%, 주관식 8% → 10%
          100증례에서 모델의 조기 종료 시도 492번을 막음
          뼈대는 효과가 크지만 없는 지식을 만들지는 못합니다. 지식은 바깥에서 넣고, 종료는 코드가 판정합니다.
          Nature Medicine · 2025.01

          CRAFT-MD: 대화형 평가의 경고

          2,000개 증례를 환자 AI와의 대화로 평가했습니다. 모델이 대화로 모은 병력이 완전했던 비율은 GPT-4 71.1%, Mistral-7B 8.9%였습니다.

          환자 AI의 답이 완전했던 비율 94.25%
          빠뜨린 경우는 대개 한 턴에 질문을 여러 개 묶었을 때
          대화를 요약해 넘기면 Mistral-7B 객관식 0.426 → 0.513
          한 턴에 질문 하나. 대화 원문 대신 요약을 넘깁니다.
          NeurIPS 2024 · arXiv 2406.00922

          MediQ: 물을지 답할지의 판단

          작은 모델은 질문을 허용하자 오히려 정확도가 떨어졌습니다. 확신도 척도, 근거 작성, 세 번 생성을 합쳐야 일부 회복됐습니다.

          Llama-3-8B: 초기 정보만 52.0% · 질문 허용 33.0% · 개선판 45.8%
          반복 질문과 답할 수 없는 질문을 없애자 +2%p, 대화를 문단으로 정리하자 +5.7%p
          모델에게 “이제 충분한가”를 맡기지 않습니다. 이미 물은 것과 모른다고 한 것은 코드가 기억합니다.
          arXiv 2606.03416 · 2026.06

          MeDxAgent: 넓게 묻고 나중에 좁히기

          4,421개 주관식 증례로 대화형 진단 구성 요소를 하나씩 시험했습니다. 가장 큰 기여는 매 턴 상태를 정리하는 요약기였습니다.

          GPT-4o 기준, 감별 중심 질문을 2턴부터 켜면 34.7%, 10턴부터 켜면 52.8%
          전체 시스템 57.4% (전체 정보 상한 66.8%)
          처음엔 주호소 특성, 위험 감별, 과거력을 넓게 묻고, 기반이 쌓인 뒤 감별 중심으로 좁힙니다.
          Nature Medicine · 2026.09

          온프레미스 의료 에이전트

          같은 에이전트 구조를 여러 오픈 모델에 적용해 병원 내부 실행 가능성을 봤습니다. GPT-OSS도 포함됐습니다.

          GPT-OSS 85.3% · 클라우드 GPT-5.2 90.7%
          5번 돌린 진단의 일치도가 정답 여부를 가장 잘 예측 (AUC 0.860)
          일치도 0.90 이상만 남기면 49.4%의 증례에서 98.9% 정확
          최종 진단은 여러 번 생성하고, 일치도를 확신도로 씁니다.
          AgentClinic · arXiv 2405.07960 · 2024

          AgentClinic: 한국어 증례의 위험

          환자·의사·검사·판정 에이전트로 만든 가상 진료실입니다. 한국어를 포함한 7개 언어 버전이 있습니다.

          GPT-4o 영어 35.5% · 한국어 3.7%
          GPT-4 영어 40.2% · 한국어 20.6%
          증례가 한국어라면 추론을 영어로 할지 한국어로 할지 샘플 증례로 먼저 검증합니다.
          Google · Nature 2025

          AMIE: 턴마다 세 단계로 생각하기

          턴마다 분석(양성·음성 소견 요약, 감별, 부족한 정보, 확신도), 답변 작성, 다듬기를 차례로 호출합니다. 파인튜닝 없이 따라 할 수 있는 부분입니다.

          AMIE와 1차 진료의 모두 처음 약 10턴 안에 필요한 정보를 모음
          AMIE의 강점은 모은 정보를 해석하는 데 있었습니다
          턴마다 분석과 행동 선택을 나눠서 호출합니다. 초반 10턴 안팎의 질문 품질이 중요합니다.

          MAI-DxO의 가상 의사 패널을 우리 방식으로

          Dr. Hypothesis

          확률 순위로 상위 감별 3개를 유지하고 소견마다 갱신합니다.

          감별 갱신 호출. 확률 계산은 코드가
          Dr. Test-Chooser

          선두 가설들을 가장 잘 가르는 검사를 고릅니다.

          후보 행동의 기대 정보량을 코드가 계산
          Dr. Challenger

          반론 역할. 앵커링과 반대 증거를 찾고 반증할 검사를 제안합니다.

          진단 직전의 반론 호출 한 번
          Dr. Stewardship

          같은 정보를 더 싸게 얻는 길, 특히 환자에게 먼저 묻는 길을 찾습니다.

          비용·침습도 벌점, 검사 전에 문진
          Dr. Checklist

          검사 이름이 유효한지, 판단이 서로 모순되지 않는지 봅니다.

          규칙 검증으로 코드에서 처리

          우리 설계로 옮길 교훈

          • 상태는 코드에, 모델에는 매번 새로 쓴 요약을. 요약을 넘기는 방식이 여러 연구에서 공통으로 효과를 냈습니다(CRAFT-MD, MediQ, MeDxAgent).
          • 모델의 “이제 진단해도 된다”는 신호를 믿지 않습니다. 한 연구에서 모델 자체의 종료 점수는 오진 예측력이 AUROC 0.552로 동전 던지기에 가까웠습니다. 종료는 코드 관문이 정합니다.
          • 처음엔 넓게, 나중에 좁게. 감별 중심 질문을 너무 일찍 시작하면 앵커링으로 크게 떨어집니다(MeDxAgent 34.7% 대 52.8%).
          • 한 턴에 쉬운 말로 질문 하나, 검사는 정확한 이름으로. SDBench 게이트키퍼는 “피검사” 같은 모호한 요청을 거절하고 “CBC”처럼 구체적인 이름을 요구합니다.
          • 60턴은 한도일 뿐입니다. 연구들의 적정 범위를 보면 행동 12–25회를 출발점으로 두고, 가중치가 공개되면 조정하는 것이 합리적입니다(우리 추정).
          • 진단명은 하나, 근거가 허락하는 만큼 구체적으로. 표준 용어로 쓰고 “가능성”, “배제 필요” 같은 얼버무림과 무관한 진단 나열은 뺍니다.
          • 환경이 돌려주지 않은 결과는 절대 쓰지 않습니다. 최고 부품만 모은 한 시스템은 13.87%의 증례에서 검사 결과를 지어냈습니다.
          • 오류의 대부분은 증거 문제입니다. 한 분석에서 오류의 50.4%는 결정적 증거를 모으지 않아서, 37.6%는 모아 놓고 쓰지 않아서 생겼습니다(CDEG).
          • 부품이 아니라 전체로 검증합니다. 가장 좋은 부품만 모은 시스템이 67.7%로, 잘 통합된 시스템(77.4%)보다 낮았습니다.
          C2 · 설계 방향

          코드가 흐름을 쥐고, LLM은 짧게 판단합니다

          Claude Code나 Codex 같은 에이전틱 하네스는 최상위 모델이 스스로 계획하고 도구를 쓰게 둡니다. gpt-oss-20b는 추론은 좋지만 긴 자율 루프에서 쉽게 흔들립니다. 그래서 진료의 흐름은 코드(상태 머신)가 관리하고, 모델에게는 한 번에 한 가지 판단만 맡깁니다.

          AGENTIC HARNESSClaude Code · Codex 방식

          에이전틱 하네스

          LLM이 대화 전체를 들고 다음 행동을 스스로 결정합니다.

          LLM⇄도구⇄LLM⇄도구…
          잘 맞는 모델
          긴 작업을 스스로 끌고 가는 최상위 프런티어 모델
          20B급에서 생기는 문제
          같은 질문 반복, 목표 이탈, 출력 형식 깨짐, 60턴 동안 불어나는 문맥
          WORKFLOW · STATE MACHINE우리 선택

          워크플로 · 상태 머신

          코드가 순서를 정하고, 단계마다 LLM에게 좁은 질문 하나를 던집니다.

          코드→LLM 감별→코드 행동 선택→LLM 응답 해석→코드 종료 판정
          얻는 것
          재현성, 안정성, 어느 단계에서 틀렸는지 추적 가능
          치르는 것
          설계 공수. 임상 지식을 규칙과 체크리스트로 옮기는 일이 필요합니다

          Doctor Agent 파이프라인

          1

          초기 정보 정리

          나이, 성별, 주호소, 발병 시점을 구조화된 상태로 만듭니다.

          코드LLM · low
          2

          감별진단 세우기

          가능한 진단 5–8개를 여러 번 생성해 합칩니다. 주호소별로 놓치면 안 되는 질환은 규칙으로 항상 추가합니다.

          LLM · high의사 팀원 목록
          3

          다음 행동 고르기

          후보 질문·진찰·검사 가운데 현재 감별을 가장 잘 가르는 것을 고릅니다. 처음 몇 턴은 주호소의 특성, 위험 감별, 과거력과 약물을 넓게 묻고, 기반이 쌓이면 감별 중심으로 좁힙니다. 이미 물은 것은 다시 묻지 않습니다.

          코드LLM · medium의사 팀원 체크리스트
          4

          응답 해석

          환자의 답과 검사 결과에서 양성·음성 소견을 JSON으로 뽑아 상태에 기록합니다.

          LLM · low코드 검증
          5

          감별 갱신

          LLM의 판단과 임상 점수 규칙(예: Alvarado)을 합쳐 순위를 다시 매깁니다.

          LLM · medium임상 점수 규칙
          6

          종료 판단

          필수 문진과 진찰을 마쳤는지, 위험 감별을 배제했는지, 1위의 확신도와 여러 번 생성한 감별의 일치도, 남은 턴을 보고 코드가 정합니다. 모델이 먼저 끝내자고 해도 이 관문을 통과해야 합니다.

          코드
          7

          최종 진단

          5번 생성해 가장 많이 나온 진단을 고릅니다 → 규칙 검증(모은 소견과 모순이 없는지) → 반론 역할의 재평가 → 근거가 허락하는 만큼 구체적인 표준 진단명 하나로 정리 → DIAGNOSE.

          LLM · high규칙진단명 사전

          설계 원칙

          • 한 턴에 질문 하나CRAFT-MD에서 환자 AI가 답을 빠뜨린 경우는 대개 한 턴에 질문을 여러 개 묶었을 때였고, SDBench에서는 하나씩 물어도 정확도가 같았습니다. 가이드가 공개되면 다시 판단합니다.
          • 모든 호출은 JSON형식을 검증하고, 실패하면 다시 요청하고, 그래도 실패하면 안전한 기본 행동으로 넘어갑니다.
          • 추론 강도는 단계별로정보 추출은 low, 감별과 최종 진단은 high. 시간 제한 안에서 생각을 배분합니다.
          • 대화 전문 대신 상태 요약컨텍스트를 짧게 유지해 작은 모델이 핵심에 집중하게 합니다.
          • 규칙이 마지막 안전망위험 감별을 확인하기 전에는 진단하지 않고, 근거 없는 침습적 검사는 막습니다.
          • 지식은 50MB 안에주호소별 체크리스트, 질환–소견 표, 진단명 동의어 사전처럼 압축된 형태로 담습니다.

          하루 1회 제출을 버티는 로컬 평가

          서버 채점은 예선 기간에 많아야 11번입니다. 나머지 실험은 모두 로컬에서 돌리고, 가장 좋은 버전만 제출합니다.

          1

          평가 증례

          공개 샘플, 의사 팀원이 쓴 증례, LLM이 만들고 의사 팀원이 검수한 증례

          2

          로컬 가상 환자

          크레딧으로 GPT 모델을 불러 숨은 소견 안에서만 답하게 합니다

          3

          우리 에이전트

          gpt-oss-20b로 실제 제출과 같은 조건에서 실행

          4

          로컬 채점기

          진단 일치는 GPT 채점, 턴·검사 수와 위험 감별 확인은 규칙으로

          5

          오류 분석

          의사 팀원이 대화 기록을 리뷰하고 오류 유형을 분류

          ↺ 수정 후 1번으로. 하루의 마지막에 가장 좋은 버전 하나만 서버에 제출
          기록 의무

          외부 LLM으로 만든 증례와 라벨은 생성 코드, 프롬프트, 모델 버전을 남겨 둡니다. 수상하면 재현 자료로 제출해야 합니다.

          지원서에 적은 접근 전략

          참가 신청서 · 팀 소개 및 참가 동기 중흐름 제어는 코드(상태 머신)가, LLM은 짧고 구조화된 판단만 맡습니다. 감별진단 후보를 유지하며 이를 가장 잘 가르는 문진·검사를 고르고, 소형 임베딩 RAG로 근거를 보강합니다. 최종 진단은 퀀트에서 검증한 “다중 생성 → 룰 검증 → 재평가”로 확정하고, 자가 라벨링 로컬 평가셋으로 제출 제한을 보완합니다.
          C3 · 역할과 일정

          누가 무엇을 맡나

          의사 팀원은 코딩하지 않아도 됩니다. 문서나 스프레드시트로 주면 코드와 프롬프트로 옮깁니다. 임상 판단이 들어가는 자리가 곧 점수가 갈리는 자리입니다.

          CLINICAL

          임상 담당 · 의사 팀원

          1. 주호소별 문진 체크리스트복통, 흉통, 두통, 발열, 호흡곤란 등. OPQRST, 동반 증상, 과거력, 약물, 사회력.
            → 파이프라인 3단계
          2. 놓치면 안 되는 질환과 확인 질문예: 흉통이면 급성 관상동맥증후군, 대동맥 박리, 폐색전증, 긴장성 기흉.
            → 안전성
          3. 검사 적절성 규칙1차 검사와 확진 검사의 순서, 침습·방사선·고비용 검사를 해도 되는 조건.
            → 안전성 · 효율성
          4. 진단명 사전동의어, 약어, 한영 표기, 채점에 알맞은 구체성.
            → 정확도
          5. 평가 증례 제작과 검수숨은 소견이 있는 가상 증례를 쓰고, LLM이 만든 증례의 임상 타당성을 봅니다.
            → 로컬 평가
          6. 대화 기록 리뷰전공의 차트 리뷰처럼 불필요한 질문, 빠진 질문, 위험한 검사를 표시합니다.
            → 오류 분석
          7. 본선 발표의 임상 논리포스터에 따르면 심사위원단의 정성 평가가 있습니다.
            → 본선
          ENGINEERING

          개발 담당

          1. 상태 머신과 모델 호출부harmony 형식, 추론 강도 설정, JSON 검증과 재시도.
          2. 로컬 평가 하네스가상 환자, 채점기, 실험 기록.
          3. 지식 압축과 검색체크리스트와 사전을 50MB 안에 담고 CPU에서 검색.
          4. 제출 패키징run.py, requirements.txt, 재현 자료.
          5. 본선 모델 전략VRAM 20GB 이하 모델 선택과 파인튜닝 검토.
          6. 규정과 공지 추적참가자 가이드, 세부 지표, 운영 메일.

          일정별 할 일

          1. 09.30 – 10.03(토) · 지금

            접수 정리

            개발
            개인 신청 건과 팀 신청 건 중복 문의 메일 발송. 팀명과 신청 이메일을 적고, 모델 리비전 불일치 확인 질문도 같은 메일에 넣습니다.
            의사
            PART 0 수업과 PART B 읽기. 신청서의 팀원 정보가 맞는지 확인.
          2. 10.06(화) 10:00–12:00

            온라인 개회식

            함께
            세부 지표와 가중치, 참가자 가이드 공개 일정, 가상 환자 방식 확인.
          3. 가이드 공개 – 10.11(일)

            예선 준비

            개발
            베이스라인 에이전트와 로컬 평가 하네스.
            의사
            주요 주호소 체크리스트와 위험 감별 목록 1차본, 평가 증례 초안.
          4. 10.12(월) – 10.22(목)

            예선 · 11일

            개발
            하루 1회 제출, 실험 관리.
            의사
            매일 대화 기록 리뷰, 오류 유형 정리.
          5. 예선 종료 후

            검증 자료 제출 (본선 진출 대상일 때)

            함께
            재현 코드와 실행 방법, 출처·라이선스 명세, 팀원 정보.
          6. 10.27(화) – 11.10(화)

            본선 · 15일

            개발
            모델 제한 해제 대응(VRAM 20GB 이하).
            의사
            발표 자료의 임상 논리.
          7. 11.20(금)

            시상식

            함께
            장소는 추후 안내.
          C4 · 확인할 것

          개회식과 참가자 가이드에서 확인할 것

          아래 항목에 따라 설계가 바뀝니다. 공개되는 대로 이 문서를 고칩니다.

          • 서버의 모델·리비전·추론 엔진. 규정의 해시가 gpt-oss-20b가 아니라 Gemma 4 커밋과 일치합니다. 지금 문의합니다.
          • API 기능. 추론 강도(reasoning_effort)와 JSON 스키마 제약을 요청에서 지정할 수 있는지.
          • 세부 지표와 가중치. 효율성을 턴 수로 보는지, 검사 비용으로 보는지.
          • 가상 환자의 작동 방식. LLM 시뮬레이터인지, 한 턴에 여러 질문을 받아 주는지.
          • 증례의 언어와 범위. 한국어인지 영어인지, 어떤 진료과까지 나오는지.
          • 진찰·검사 항목의 형식. 정해진 목록에서 고르는지, 자유 텍스트로 요청하는지.
          • 진단 제출 형식. 자유 텍스트인지 코드인지, 복수 진단을 받는지.
          • 실행 환경. 증례당 제한 시간, GPU 종류, 서버 CPU·RAM, requirements.txt 설치 때 네트워크 사용 여부.
          • 본선 제출 형식과 평가 방식. 발표 심사의 비중.
          • 참가 자격. 포스터에만 있는 ‘내국인’ 조건이 팀원 모두에게 해당하는지.
          • 공정성 평가 여부. 지난 세 대회는 모두 성별·연령대별 성능 차이를 채점했습니다.
          • 채점 모델과 기준표. M.A.R.S.의 gpt-oss-120b처럼 오픈 모델인지, 진단 일치를 몇 점 척도로 보는지.
          출처

          출처

          2026년 9월 30일에 확인한 자료입니다. 참가팀 기록은 각 팀의 자체 기록이고, 모델 벤치마크 수치는 대부분 개발사가 발표한 값입니다.

          N.O.V.A. 2026 공식

          이전 대회

          gpt-oss-20b

          모델 지형

          선행 연구

          설계 개념

          작성 2026.09.30공개 자료 기준 · 비공식 팀 내부 자료규정은 참가자 가이드에서 바뀔 수 있습니다