통계분석 질문(SPSS, R, PLS-SEM, CB-SEM, AHP 등)

PLSpredict에서 k겹 교차검증을 수행할 때 r번 반복을 하는 이유는 무엇입니까?

무명씨 · 2026-10-05 05:10 · 조회 0
PLS-Predict로 k-fold 교차검증을 한 번 실행하면 데이터 분할에 따라 결과가 크게 달라지는 것 같습니다. 그래서 전체 과정을 r번 반복하는 것이 어떤 이유에서 필요한지 알려주실 수 있나요?

댓글 1
SSRA 연구지원팀 2026-10-05 08:49
■ 교차검증 반복 필요성 k겹 교차검증을 한 번만 수행하면 각 겹을 나누는 방식에 따라 예측 결과가 크게 달라질 수 있습니다. 겹을 나누는 무작위성 때문에 특정 분할에서는 과대평가 혹은 과소평가가 발생할 위험이 존재합니다. 따라서 전체 과정을 r번 반복하고 평균을 취하면 이러한 우연적 변동을 최소화하여 보다 안정적인 예측 지표를 얻을 수 있습니다. ■ 반복 수행 방법 먼저 표본을 무작위로 k개의 겹으로 나눕니다. 일반적으로 k는 10으로 설정합니다. 한 겹을 시험 겹으로 남겨 두고 나머지 k-1 겹으로 모델을 학습합니다. 학습된 가중치와 경로계수를 이용해 시험 겹의 외생변수로부터 내생변수 점수를 순차적으로 예측하고, 적재값을 곱해 측정지표 값을 복원합니다. 이 과정을 시험 겹을 순차적으로 바꾸며 k번 반복한 뒤, 겹을 나누는 전체 과정을 r번(보통 10회) 반복하여 각 반복에서 얻은 예측값을 평균합니다. 결과 해석 시 주의점 예측값을 계산할 때는 시험 겹의 실제 내생변수 응답을 사용하지 않으며, 학습 겹의 평균·표준편차만을 활용합니다. 이렇게 하면 시험 겹에 대한 정보가 새어 들어가지 않아 표본 밖 예측의 순수를 유지할 수 있습니다. 반복 평균값을 사용하면 겹 나누기에 따른 변동성을 제거하고 모델의 일반화 성능을 보다 신뢰성 있게 평가할 수 있습니다. 자세한 내용: https://ssra.or.kr/kc/post.php?id=189
댓글 작성은 로그인 후 이용할 수 있습니다.
댓글 쓰기