순서가 있습니다. 포털 넷(연구방·지식센터·커뮤니티·아카데미)을 먼저 담고,
SSRA 는 맨 나중에 담아 주세요. SSRA 를 먼저 담으면 나머지가 그 안에 포함된 것으로
잡혀 따로 담기지 않습니다. 아이콘도 담을 차례대로 놓았습니다 — 왼쪽부터 차례로 누르시면 됩니다.
Evaluating large language models in theory of mind tasks
Michał Kosiński · Proceedings of the National Academy of Sciences · 2024년 · 조회 13
왜 이 논문인가 — 선정 기준
HOT PAPER · 최근 가장 주목받는 논문 — 피인용·FWCI·동년 인용 백분위
2024-10 발표 · 피인용 199회 · 분야 내 인용 영향력 상위권 · 동년 인용 상위 1%
HOT PAPER 슬롯은 인용 199회와 동년 논문 상위 1%라는 높은 인용 영향력을 근거로 선정되었다.
논문 요약
연구자는 11개의 대형 언어 모델(LLM)을 40개의 맞춤형 거짓 신념 과제로 평가하였다. 각 과제는 거짓 신념 상황, 세 개의 진실 신념 통제 상황, 그리고 이 네 상황의 역버전으로 구성되었다. 구형 모델은 과제를 전혀 해결하지 못했으며, GPT‑3‑davinci‑003와 ChatGPT‑3.5‑turbo는 20% 수준, ChatGPT‑4는 75%를 해결해 6세 아동의 성과와 일치하였다. 이러한 결과를 바탕으로 ToM‑유사 능력이 인간 고유라 여겨졌던 특성이 LLM의 언어 능력 향상의 부수적 산물일 가능성을 논의한다.
후속 연구설계에 활용하기
동일한 거짓 신념 과제 세트를 변수·척도로 활용해 모델·학습 데이터 규모와 ToM 성과 간의 관계를 추적하는 종단 연구를 설계할 수 있다.
핵심어
대형 언어 모델이론적 마음거짓 신념 과제아동 발달
실존 확인
이 논문은 OpenAlex에서 후보로 수집한 뒤, Crossref에 등록된 DOI와 제목 일치를 확인해 노출합니다.
SSRA가 문헌연구에서 인용 논문의 실재 여부를 검증하는 원칙과 같습니다.