순서가 있습니다. 포털 넷(연구방·지식센터·커뮤니티·아카데미)을 먼저 담고,
SSRA 는 맨 나중에 담아 주세요. SSRA 를 먼저 담으면 나머지가 그 안에 포함된 것으로
잡혀 따로 담기지 않습니다. 아이콘도 담을 차례대로 놓았습니다 — 왼쪽부터 차례로 누르시면 됩니다.
Karan Singhal, Shekoofeh Azizi, Tao Tu 외 · Nature · 2023년 · 조회 26
왜 이 논문인가 — 선정 기준
RESEARCH PAPER · 후속 연구설계에 활용하기 좋은 논문 — 척도·모형·프레임워크류, 피인용 다수
2023-07 발표 · 피인용 3,697회 · 분야 내 인용 영향력 상위권 · 동년 인용 상위 1% · 참고문헌 91개
RESEARCH PAPER 슬롯은 후속 연구 설계에 활용도가 높은 논문을 선정하는데, 본 논문은 3697회의 피인용 및 분야 상위 1% 인용 영향력으로 후속 연구에 풍부한 자료를 제공한다.
논문 요약
대형 언어 모델(LLM)의 임상 적용을 평가하기 위해, 기존 의료 질문답변 데이터 6개와 새로운 HealthSearchQA를 결합한 MultiMedQA 벤치마크를 만든다. 또한 사실성·이해·추론·위해·편향 등 다축 인간 평가 프레임워크를 제시한다. PaLM 540 b와 그 파인튜닝 변형 Flan‑PaLM 2를 MultiMedQA에 적용한 결과, 다양한 프롬프트 전략을 통해 최신 성능을 달성하였다.
후속 연구설계에 활용하기
MultiMedQA의 질문 유형·평가 축을 변수로 삼아, 새로운 의료 LLM의 사실성·위험도 등을 체계적으로 비교하는 실험 설계에 활용할 수 있다.
핵심어
대형언어모델임상지식의료벤치마크인간평가
실존 확인
이 논문은 OpenAlex에서 후보로 수집한 뒤, Crossref에 등록된 DOI와 제목 일치를 확인해 노출합니다.
SSRA가 문헌연구에서 인용 논문의 실재 여부를 검증하는 원칙과 같습니다.