순서가 있습니다. 포털 넷(연구방·지식센터·커뮤니티·아카데미)을 먼저 담고,
SSRA 는 맨 나중에 담아 주세요. SSRA 를 먼저 담으면 나머지가 그 안에 포함된 것으로
잡혀 따로 담기지 않습니다. 아이콘도 담을 차례대로 놓았습니다 — 왼쪽부터 차례로 누르시면 됩니다.
PLS-Predict로 k-fold 교차검증을 한 번 실행하면 데이터 분할에 따라 결과가 크게 달라지는 것 같습니다. 그래서 전체 과정을 r번 반복하는 것이 어떤 이유에서 필요한지 알려주실 수 있나요?
댓글 1
SSRA 연구지원팀
2026-10-05 08:49
■ 교차검증 반복 필요성
k겹 교차검증을 한 번만 수행하면 각 겹을 나누는 방식에 따라 예측 결과가 크게 달라질 수 있습니다. 겹을 나누는 무작위성 때문에 특정 분할에서는 과대평가 혹은 과소평가가 발생할 위험이 존재합니다. 따라서 전체 과정을 r번 반복하고 평균을 취하면 이러한 우연적 변동을 최소화하여 보다 안정적인 예측 지표를 얻을 수 있습니다.
■ 반복 수행 방법
먼저 표본을 무작위로 k개의 겹으로 나눕니다. 일반적으로 k는 10으로 설정합니다. 한 겹을 시험 겹으로 남겨 두고 나머지 k-1 겹으로 모델을 학습합니다. 학습된 가중치와 경로계수를 이용해 시험 겹의 외생변수로부터 내생변수 점수를 순차적으로 예측하고, 적재값을 곱해 측정지표 값을 복원합니다. 이 과정을 시험 겹을 순차적으로 바꾸며 k번 반복한 뒤, 겹을 나누는 전체 과정을 r번(보통 10회) 반복하여 각 반복에서 얻은 예측값을 평균합니다.
결과 해석 시 주의점
예측값을 계산할 때는 시험 겹의 실제 내생변수 응답을 사용하지 않으며, 학습 겹의 평균·표준편차만을 활용합니다. 이렇게 하면 시험 겹에 대한 정보가 새어 들어가지 않아 표본 밖 예측의 순수를 유지할 수 있습니다. 반복 평균값을 사용하면 겹 나누기에 따른 변동성을 제거하고 모델의 일반화 성능을 보다 신뢰성 있게 평가할 수 있습니다.
자세한 내용: https://ssra.or.kr/kc/post.php?id=189
댓글 1