교차 검증(통계)
Cross-validation (statistics)교차[5][6][7] 검증([2][3][4]회전 추정 또는 표본 외 검정이라고도 함)은 통계 분석 결과가 독립적인 데이터 집합으로 일반화되는 방법을 평가하기 위한 여러 유사한 모형 검증 기법 중 하나입니다.교차 검증은 데이터의 서로 다른 부분을 사용하여 모형을 서로 다른 반복으로 검정하고 훈련하는 재표본 추출 방법입니다.이 값은 주로 예측이 목표인 설정에서 사용되며 예측 모형이 실제로 얼마나 정확하게 수행되는지 추정하려고 합니다.예측 문제에서 모델에는 일반적으로 교육이 실행되는 알려진 데이터 데이터 세트(훈련 데이터 세트)와 모델이 테스트되는 미지의 데이터 세트(또는 처음 보는 데이터 세트)[8][9]가 주어집니다.교차 검증의 목표는 모델을 추정하는 데 사용되지 않은 새로운 데이터를 예측하는 모델의 능력을 테스트하여 과적합 또는 선택[10] 편향과 같은 문제를 표시하고 모델이 독립적인 데이터 집합(예: 실제 문제에서 알 수 없는 데이터 집합)으로 일반화하는 방법에 대한 통찰력을 제공하는 것이다.
교차 검증의 한 라운드에는 샘플 데이터를 보완적인 서브셋으로 분할하고, 한 서브셋(트레이닝 세트라고 함)에 대한 분석을 수행하고, 다른 서브셋(검증 세트 또는 테스트 세트라고 함)에 대한 분석을 검증하는 작업이 포함됩니다.가변성을 줄이기 위해 대부분의 방법에서 여러 개의 교차 검증을 서로 다른 파티션을 사용하여 수행하며, 검증 결과는 모델의 예측 성능에 대한 추정치를 제공하기 위해 라운드에 걸쳐 결합된다(예: 평균).
요약하면 교차 검증은 예측 적합성의 측정(평균)을 결합하여 모형 예측 [11]성능에 대한 보다 정확한 추정치를 도출합니다.
동기
하나 이상의 알 수 없는 모수가 있는 모형과 모형을 적합시킬 수 있는 데이터 세트(교육 데이터 세트)를 가정합니다.적합 공정은 모형 모수를 최적화하여 모형이 교육 데이터에 적합하도록 합니다.검증 데이터의 독립 표본을 교육 데이터와 동일한 모집단에서 추출하는 경우, 일반적으로 모형이 검증 데이터에 적합할 뿐만 아니라 교육 데이터에도 적합하지 않은 것으로 판명됩니다.이 차이의 크기는 교육 데이터 세트의 크기가 작거나 모형의 모수 수가 많은 경우에 특히 클 수 있습니다.교차 검증은 이 효과의 크기를 추정하는 방법입니다.
선형 회귀에는 진정한 반응 값,..., yn, ny1p-dimensional 벡터 covariates x1,..., xn 존재한다.벡터 자이의 요소는 표시 xi1,..., xip.만약 최소한 서로 부합된 초평면 ŷ의 형태로)데이터에 기능은+βTx에 맞게 사용된다 나는, 다음의 평균 제곱 오차(유도탄 지원 반)를 활용하여 평가될 수 있n≤ 1≤(자이, yi).훈련 세트(xi, yi) 1 ≤ i ≤ n에서 주어진 추정 매개변수 값 a 및 β에 대한 MSE는 다음과 같이 정의된다.
모델이 올바르게 지정되어 있는 경우, 훈련 세트에 대한 MSE의 기대치가 (n - p - 1)/(n + p + 1) < 검증 세트에[12][irrelevant citation] 대한 MSE의 기대치의 1배라는 경미한 가정 하에 나타날 수 있다(기대치는 훈련 세트의 분포보다 우선한다).따라서 교육 세트에 적합된 모형과 계산된 MSE는 모형이 독립 데이터 세트에 얼마나 잘 적합할 것인지에 대해 낙관적으로 편향된 평가를 초래할 것입니다.이러한 치우친 추정치를 적합치의 표본 내 추정치라고 하는 반면 교차 검증 추정치는 표본 외 추정치입니다.
선형 회귀 분석에서는 모델 규격이 유효하다고 가정하여 훈련 MSE가 검증 MSE를 과소평가하는 요인(n - p - 1)/(n + p + 1)을 직접 계산할 수 있으므로 교차 검증을 사용하여 모형이 초과 적합되었는지 여부를 확인할 수 있으며, 이 경우 검증 집합의 MSE가 하위가 됩니다.기대치를 stantally 초과합니다.(선형 회귀 분석의 맥락에서의 교차 검증은 최적 정규화된 비용 함수를 선택하는 데 사용할 수 있다는 점에서도 유용합니다.)대부분의 다른 회귀 분석 절차(예: 로지스틱 회귀 분석)에서는 기대 표본 외 적합치를 계산할 수 있는 간단한 공식이 없습니다.따라서 교차 검증은 이론 분석 대신 수치 계산을 사용하여 사용할 수 없는 데이터에 대한 모델의 성능을 예측하는 일반적으로 적용할 수 있는 방법입니다.
종류들
교차 검증에는 완전 교차 검증과 비완전 교차 검증의 두 가지 유형을 구별할 수 있습니다.
철저한 교차 검증
철저한 교차 검증 방법은 원본 표본을 교육 및 검증 세트로 나누는 모든 가능한 방법을 학습하고 테스트하는 교차 검증 방법입니다.
생략-p-out 교차 검증
이탈-p-out 교차 검증(LpO CV)에는 p개의 관측치를 검증 세트로 사용하고 나머지 관측치를 교육 세트로 사용하는 것이 포함됩니다.이는 p개 관측치의 유효성 검사 집합과 교육 [13]집합에서 원래 표본을 절단하는 모든 방법에 대해 반복됩니다.
LpO 크로스 확인 관찰을 원견본에서 n이 시험 번호인 곳 훈련과 모델 C의 유효성을 검사하 p n{\displaystyle C_{p}^{n}}이고 어디 Cpn{\displaystyle C_{p}^{n}}는 이항 계수를 요구합니다.p>1과 심지어 적당히 큰 n에 대해, LpO CVcomputationally 실행 불가능한이 될 수 있다.예를 들어,)를 100및 p 위해 30, C30100≈ 3× 1025.{\displaystyle C_{30}^{100}\approx 3\times 10^{25}.}
LpO 크로스 확인의 p=2을 가진 변종 leave-pair-out 크로스 확인으로 알려진 이진 classifiers의 ROC곡선 밑의 구역을 추정할 수 있는 거의 공정한 방법으로 추천되어 왔다.[14]
생략형 교차 검증
leave-p-out 크로스 확인 p과 Leave-one-out 크로스 확인(LOOCV)은 특정 사례가)1.그 과정 jackknife과 비슷한 반면, jackknifing과 하나는 kept 샘플에서만 통계를 계산합니다 하지만, 크로스 확인으로,left-out sample(s)에 통계를 계산하게 보인다.
오로지 C1n 있LOO 크로스 확인)n{\displaystyle C_{1}^{n}=n}Cpn{\displaystyle C_{p}^{n}보다는}을 전달합니다. 하지만, n{n\displaystyle}가 아직도 사건의 다른 접근 상당한 계산 시간, 그러한 a형이 필요할 수 있LpO 크로스 확인보다 적은 계산 시간을 필요로 한다Sk-fold 교차 검증 더 적절할 수 있다.[15]
유사 코드 알고리즘:
입력:
x, {착신 점의 x 값이 있는 길이 N의 벡터}
y, {예상된 결과의 y 값이 있는 길이 N의 벡터}
보간( x_in, y_in, x_out), { 모델이 x_in-y_in 쌍으로 학습된 후 x_out 포인트에 대한 견적을 반환합니다.
출력:
err, {예측 오류 발생}
순서:
err ← 0 for i ← 1, ..., N do // 교차 검증 하위 집합 x_in ← (x[1], ..., x[i - 1], ..., x[N]) y_in ← (y[1], ..., y[i - 1], y[1], y[1], y[1], ..., y[1], y[1], Y[1], Y[1], Y[1], ..., Y[1], Y[x[x[N], ..., Y[x[x[N]의 x[N]의 X[N]의
비소진 교차 검증
비소진 교차 검증 방법은 원래 표본을 분할하는 모든 방법을 계산하는 것은 아닙니다.이러한 방법은 생략된 교차 검증의 근사치입니다.
k배 교차 검증
k-접이식 교차 검증에서는 원래 표본이 k개의 동일한 크기의 하위 표본으로 랜덤하게 분할됩니다.k개의 서브샘플 중 1개의 서브샘플이 모델 테스트를 위한 검증 데이터로 유지되며, 나머지 k - 1 서브샘플이 훈련 데이터로 사용된다.그런 다음 교차 검증 과정을 k회 반복하고 각 k개의 하위 표본을 검증 데이터로 정확히 한 번 사용합니다.그런 다음 k개의 결과를 평균화하여 단일 추정치를 생성할 수 있습니다.반복 랜덤 서브샘플링(아래 참조)에 비해 이 방법의 장점은 모든 관측치가 훈련과 검증에 사용되며 각 관측치는 검증에 정확히 한 번 사용된다는 것이다. 일반적으로 10배 교차 검증이 [16]사용되지만 일반적으로 k는 고정되지 않은 매개변수로 남아 있다.
예를 들어, k = 2로 설정하면 2배 교차 검증이 수행됩니다.2배 교차 검증에서는 데이터 세트를 2개의0 세트1 d와 d로 랜덤하게 셔플하여 두 세트의 사이즈를 같게 합니다(보통 데이터 어레이를 셔플한 후 2개로 분할하여 구현합니다).그런 다음 d에 대해0 훈련하고 d에 대해1 검증한 후 d에 대한1 훈련과 d에 대한0 검증을 수행합니다.
언제 k=n(관찰의 수),k-fold 크로스 확인leave-one-out 크로스 확인에 해당합니다.[17]
그래서 평균 응답 값 약 모든 파티션으로 동일한 중층 k-fold 크로스 확인에서 파티션 선택된다.2진 분류의 경우, 이것은 각 파티션 클래스 라벨 두 종류의 대체로 같은 비율을 포함한다는 것을 의미한다.
반복되는 크로스 확인에서 데이터가 무작위로 k파티션으로 여러번 엇갈리고 있다.모델의 성능 여러점이 넘었지만 그런 경우는 드무연습에서 바람직하다. 평균을 낼 수 있다.[18]
홀드아웃 방식
는 홀드 아웃 방법에서, 우리는 무작위적 두세트 d0과 1는데, 보통 훈련이 시험 집합, 각각 불리는 데이터 포인트를 배분한다.비록 일반적으로 시험 집합을 훈련 세트보다 작은 각 세트의 크기는 자의적이야.우리는 그렇다면 1에 d0과 시험(그것의 성능 평가)에(모델을 만들)을 훈련한다.
전형적인 크로스 확인에서 model-testing의 여러점의 결과라 반대로 홀드 아웃 법에 의해 격리, 싱글 패스하는 것을 포함하는 평균을 낸다.그것은 조심해서가 잘못된 결과를 달성할 수 있도록 여러점이, averaging이 없다면 사용해야 한다.예측 정확도의 한가지의 지표(F*) 이후 다중 반복 횟수(아래 참조)에 의해 펴지지 않을 것이다 불안한 경향이 있을 것이다.마찬가지로, 특정 역할은 다양한 예측 변수(예를 들어, 회귀 계수의 값)에 관한 지표 불안한 경향이 있을 것이다.
이 홀드 아웃 법"크로스 확인의 가장 단순한 종류"[19] 많은 원인들로 표현된 수 있는 대신 단순한 유효성 검사의 일종인보다는 크로스 확인을 신설 또는 퇴화된 간단한 형태로 홀드 아웃 분류하고 있습니다.[6][20]
반복 랜덤 서브샘플링 검증
이 방법은 몬테카를로 cross-validation,[21]로 알려진 데이터 집합의 훈련 및 검증 데이터가 여러 임의 분해를 만듭니다.[22]각 해당 분할 내용은 모델은 훈련 데이터로 되고, 예측 정확도가 검증 데이터를 활용하여 평가된다 좋은 조건을 갖추고 있다.그 결과는 분열을 평균을 낸다.이 방법의 장점(k배 교차 검증 대비)은 훈련/검증 분할의 비율이 반복 횟수(즉, 파티션 수)에 따라 달라지지 않는다는 것이다.이 방법의 단점은 검증 하위 표본에서 일부 관측치를 선택하지 않을 수 있는 반면 다른 관측치를 두 번 이상 선택할 수 있다는 것입니다.즉, 검증 서브셋이 중복될 수 있습니다.이 방법은 또한 몬테 카를로 변동을 나타내며, 이는 분석이 다른 무작위 분할로 반복될 경우 결과가 달라질 것임을 의미한다.
랜덤 분할의 수가 무한대에 가까워짐에 따라 반복적인 랜덤 서브 샘플링 검증의 결과는 생략된 p-out 교차 검증의 결과로 향하는 경향이 있다.
이 접근법의 계층화된 변형에서, 무작위 표본은 평균 응답 값(즉, 회귀의 종속 변수)이 훈련 및 테스트 세트에서 동일하도록 생성된다.이 값은 데이터 내의 두 반응 값이 불균형하게 표현되어 있고 반응이 이분법적인 경우에 특히 유용합니다.
반복 랜덤 서브샘플링을 적용하는 방법은 LANSAC입니다.[23]
내포 교차 검증
최적의 하이퍼 파라미터 세트의 선택과 오차 추정(및 일반화 용량의 평가)을 위해 교차 검증을 동시에 사용하는 경우 중첩 교차 검증이 필요합니다.많은 변종이 존재합니다.적어도 두 가지 변형을 구별할 수 있습니다.
k*l배 교차 검증
이것은 k 세트의 외부 루프와 l 세트의 내부 루프를 포함하는 진정으로 중첩된 변형입니다.총 데이터 세트는 k개 세트로 분할됩니다.하나씩 세트를 (외부) 테스트 세트로 선택하고 다른 k - 1 세트를 해당 외부 교육 세트로 결합합니다.이것은 각 k개 세트에 대해 반복된다.각 외부 교육 세트는 추가로 l개 세트로 나뉩니다.하나씩 세트를 내부 테스트(유효성 검사) 세트로 선택하고 다른 l - 1 세트를 해당 내부 교육 세트로 결합합니다.이것은 각 l 세트에 대해 반복됩니다.내부 교육 세트는 모형 모수를 적합시키는 데 사용되고 외부 테스트 세트는 모형 적합에 대한 치우침 없는 평가를 제공하기 위해 검증 세트로 사용됩니다.일반적으로 이는 많은 다른 하이퍼 파라미터(또는 다른 모델타입)에 대해 반복되며 검증세트는 이 내부 트레이닝 세트에 가장 적합한 하이퍼 파라미터 세트(및 모델타입)를 결정하기 위해 사용됩니다.그런 다음 내부 교차 검증의 최상의 하이퍼 파라미터 세트를 사용하여 전체 외부 교육 세트에 새 모델을 장착합니다.그런 다음 외부 테스트 세트를 사용하여 이 모델의 성능을 평가합니다.
k-fold 유효성 검사 및 테스트 세트 포함 교차 유효성 검사
이는 l = k - 1일 때 k*l-배 교차 검증의 한 유형입니다. 단일 k-배 교차 검증은 검증과 검정 세트 모두에 사용됩니다.총 데이터 세트는 k개 세트로 분할됩니다.1세트씩 테스트 세트로 선택됩니다.그런 다음, 가능한 모든 조합이 평가될 때까지 나머지 세트 중 하나를 유효성 검사 세트로 사용하고 나머지 k - 2 세트를 훈련 세트로 사용한다.k*l-fold 교차 검증과 마찬가지로 트레이닝 세트는 모델 피팅에 사용되며 검증 세트는 각 하이퍼 파라미터 세트에 대한 모델 평가에 사용됩니다.마지막으로 선택한 매개변수 세트에 대해 검정 세트를 사용하여 최상의 매개변수 세트를 사용하여 모형을 평가합니다.여기에서, 두 가지 변형이 가능합니다: 훈련 세트에서 훈련받은 모델을 평가하거나 열차와 검증 세트의 조합에 맞는 새로운 모델을 평가합니다.
적합도
교차 검증의 목적은 모형을 훈련하는 데 사용된 데이터와 독립적인 데이터 집합에 대한 모형의 예상 적합 수준을 추정하는 것입니다.데이터 및 모형에 적합한 적합성의 정량적 측정값을 추정하는 데 사용할 수 있습니다.예를 들어, 이진 분류 문제의 경우 검증 세트의 각 사례가 올바르게 예측되거나 잘못 예측됩니다.이 상황에서는 오분류 오류율을 사용하여 적합도를 요약할 수 있지만 양의 예측값과 같은 다른 측정값도 사용할 수 있다.예측되는 값이 연속적으로 분포되면 평균 제곱 오차, 루트 평균 제곱 오차 또는 중위수 절대 편차를 사용하여 오류를 요약할 수 있습니다.
사전 정보 사용
사용자가 크로스 검증을 적용하여 적절한 설정을 할 때 크로스 검증된 과 자신의 설정 견적 간의 균형을 맞출 수 있습니다이러한 방식으로 표본 크기가 작을 때 교차 검증의 변동성에 대응하고 이전 연구의 관련 정보를 포함할 수 있다.예를 들어 예측 조합 연습에서는 교차 검증을 적용하여 각 예측에 할당된 가중치를 추정할 수 있다.단순한 등가중치 예측은 깨기 어렵기 때문에 [24]등가중치로부터 벗어날 경우 패널티가 추가될 수 있습니다.또는 개별 가중치를 관측치에 할당하기 위해 교차 검증을 적용하는 경우, 잠재적으로 관련된 정보의 [24]낭비를 방지하기 위해 동일한 가중치에서 편차를 벌칙할 수 있다.Hoornweg(2018)는 사용자가 정의한 기준 파라미터 _에 대한 단순성과 교차검증의 정확성 사이에서 사용자가 직관적으로 균형을 잡을 수 있도록 튜닝 파라미터{를 정의하는 방법을 보여줍니다.
i})가 선택 가능한 i 후보 설정을 나타내는 경우 최소화하는 손실 함수를 다음과 같이 정의할 수 있습니다.
상대정확도는 ( i) / ( R) { { { } / { \ { i } } ( _ { r } ) / { \ mbox {} ( { }) m m m m m m m m m m error 。elative simplicity term은 R \ _ {} )elel el el el el el el el el el el el el el el el el el el el el el el el el \ _ { } from from from from from from from from from from from from from from from from from from from from from from from from from from from from from from from from from from from from from from from from from from from from from from from from from from ) _ {\ _{{R}}}) (최대{\ _max}}) {{2。여기서 \ \lambda _ lambda _ {\lambda _ {\lambda _ {\lambda } } } }\ , - 、 사용자는 기준 파라미터의 영향이 교차검증에 비해 얼마나 큰지 결정합니다.
손실 함수를 다음과 같이 지정함으로써 ,2, {\, 2, ...C의 여러 에 대해 상대적인 단순성 용어를 추가할 수 있습니다.
Hoornweg(2018)는 정확도-단순성 트레이드오프를 갖는 손실 함수를 사용하여 (적응형) 라쏘 및 베이지안/리지 [24]회귀와 같은 수축 추정치를 직관적으로 정의할 수도 있음을 보여준다.예를 보려면 래소를 클릭하십시오.
통계 속성
적합치 F의 측도를 선택하고 교차 검증을 사용하여 훈련 데이터와 동일한 모집단에서 추출한 독립 데이터 세트에 대한 모형의 기대 적합치 EF의 추정치* F를 생성한다고 가정합니다.동일한 분포에 따라 여러 개의 독립적인 훈련 세트를 표본 추출하는 것을 상상하면 F에* 대한 결과 값은 달라진다.F의* 통계적 특성은 이 변동에서 비롯됩니다.
교차 검증 추정기* F는 [25][citation needed]EF에 대해 거의 치우치지 않습니다.약간 편향된 이유는 교차 검증의 훈련 세트가 실제 데이터 세트보다 약간 작기 때문이다(예: LOOCV의 경우 훈련 세트 크기는 n - 1이다).거의 모든 상황에서 이 편향의 효과는 추정 적합도가 더 낮은 적합도를 나타내는 방향으로 약간 편향된다는 점에서 보수적일 것이다.실제로 이러한 편견이 우려되는 경우는 거의 없습니다.
F의* 분산은 [26][27]클 수 있습니다.이러한 이유로 교차검증 결과에 기초하여 두 가지 통계절차를 비교한다면, 실제로 더 나은 추정성능을 가진 절차가 두 가지 절차 중 더 낫지 않을 수 있다(즉, EF의 더 나은 값을 가지지 않을 수 있다.교차 검증 [26]추정치를 중심으로 신뢰 구간을 구성하는 데 일부 진전이 있었지만, 이는 어려운 문제로 간주됩니다.
계산상의 문제
대부분의 교차 검증 형식은 연구 중인 예측 방법의 구현이 가능한 한 구현하기 쉽다.특히 예측 방법은 '블랙박스'가 될 수 있습니다.실장 내부에는 액세스 할 필요가 없습니다.예측 방법을 교육하는 데 비용이 많이 드는 경우 훈련을 반복적으로 수행해야 하므로 교차 검증이 매우 느릴 수 있습니다.최소 제곱 및 커널 회귀와 같은 경우에 훈련에서 반복적으로 필요한 특정 값을 미리 계산하거나 셔먼-모리슨 공식과 같은 빠른 "업데이트 규칙"을 사용함으로써 교차 검증을 크게 가속화할 수 있습니다.그러나 교육 절차에서 검증 세트의 "전체 블라인딩"을 유지하도록 주의해야 합니다. 그렇지 않으면 편견이 발생할 수 있습니다.교차 검증을 가속화하는 극단적인 예는 선형 회귀 분석에서 발생합니다. 교차 검증 결과는 예측 잔차 오차 제곱합(PRESS)으로 알려진 닫힌 형식 식을 가집니다.
제한 및 오용
교차 검증은 검증 세트와 훈련 세트가 동일한 모집단에서 도출되고 인간의 편견이 통제되는 경우에만 의미 있는 결과를 산출한다.
예측 모델링의 많은 응용 프로그램에서, 연구 대상 시스템의 구조는 시간이 지남에 따라 진화한다(즉, "비정전").이 두 가지 방법 모두 교육 및 검증 세트 사이에 체계적인 차이를 가져올 수 있습니다.예를 들어, 주식가치 예측모형을 특정 5년 동안 데이터에 대해 훈련하는 경우, 후속 5년 기간을 동일한 모집단에서 추첨한 것으로 간주하는 것은 비현실적이다.또 다른 예로, 내년 안에 특정 질병으로 진단될 개인의 위험을 예측하기 위한 모델이 개발되었다고 가정합니다.모델이 특정 모집단(예: 젊은이 또는 남성)만을 포함하는 연구의 데이터를 사용하여 훈련되지만 일반 모집단에 적용되는 경우, 훈련 세트의 교차 검증 결과는 실제 예측 성과와 크게 다를 수 있다.
많은 응용 프로그램에서 모델은 잘못 지정될 수 있으며 모델러 바이어스 및/또는 임의 선택의 함수로 변화할 수 있습니다.이 경우 시스템이 외부 표본에서 변경되는 착각을 일으킬 수 있지만, 그 이유는 모형이 임계 예측 변수를 놓쳤거나 교란 예측 변수를 포함했기 때문입니다.새로운 증거는 교차 검증 자체로는 외부 유효성을 매우 예측하지 못하는 반면, 인간의 편견을 제어하는 스왑 샘플링으로 알려진 실험 검증의 형태는 [28]외부 유효성을 훨씬 더 예측할 수 있다는 것이다.30,000개 모델에 걸친 이 대규모 MAQC-II 연구에서 정의된 바와 같이 스왑 샘플링은 예측이 독립적인 훈련 및 검증 샘플에 걸쳐 테스트된다는 점에서 교차 검증을 통합한다.그러나 모델은 이러한 독립적인 표본에 걸쳐 서로에 대해 맹목적인 모델러에 의해 개발되기도 합니다.이러한 교환된 훈련 및 검증 샘플 간에 개발된 모델의 불일치가 매우 빈번하게 발생하는 경우, MAQC-II는 이것이 기존의 교차 검증보다 낮은 외부 예측 유효성을 훨씬 더 예측한다는 것을 보여준다.
교환 표본 추출이 성공한 이유는 모델 구축에서 인간의 편견을 제어하는 기능이 내장되어 있기 때문입니다.모델러에 따라 다를 수 있고 이러한 교란 모델러 효과로 인해 외부 타당성이 저하될 수 있는 예측을 지나치게 신뢰하는 것 외에도 교차 검증이 잘못 사용될 수 있는 다른 몇 가지 방법이 있다.
- 데이터 세트 전체를 사용하여 가장 유용한 기능을 식별하기 위해 초기 분석을 수행함으로써 모델링 절차에서 기능 선택 또는 모델 조정이 필요한 경우 모든 교육 세트에서 이 작업을 반복해야 합니다.그렇지 않으면 예측은 분명히 상향 [29]편중될 것이다.교차 검증을 사용하여 사용할 피쳐를 결정할 경우 모든 트레이닝 세트에 대해 피쳐 선택을 수행하기 위한 내부 교차 검증을 [30]수행해야 합니다.
- 트레이닝 데이터의 일부를 테스트 세트에 포함시킴으로써 데이터 세트의 "쌍둥이"에 의해 발생할 수 있습니다.이 경우 데이터 세트에 완전히 동일하거나 거의 동일한 샘플이 존재할 수 있습니다.완전히 독립적인 교육 및 검증 샘플에서도 어느 정도 트윈닝이 발생합니다.이는 일부 교육 표본 관측치의 예측 변수 값이 검증 표본 관측치와 거의 동일하기 때문입니다.그리고 이들 중 일부는 실제로 외부 유효성이 낮은 교란된 예측 변수에 의해 구동되는 경우 훈련과 검증 모두에서 같은 방향의 우연 수준보다 더 나은 목표와 상관 관계가 있습니다.그러한 교차 검증된 모델이 k-폴드 세트에서 선택되면, 인간 확인 편견이 작용하여 그러한 모델이 검증되었는지 결정한다.이러한 이유로 기존의 교차 검증은 인간 편중 및 스왑 표본 추출 및 사전 연구와 같은 교란된 모델 사양에 대한 제어로 보완되어야 합니다.
시계열 모델에 대한 교차 검증
데이터의 순서가 중요하기 때문에 시계열 모형의 경우 교차 검증이 문제가 될 수 있습니다.보다 적절한 접근법은 롤링 교차 [31]검증을 사용하는 것일 수 있습니다.
단, 퍼포먼스를 단일 요약 통계로 기술하는 경우, Politis와 Romano가 정지 부트스트랩으로[32] 기술하는 접근방식이 기능할 가능성이 있다.부트스트랩 통계는 시계열의 간격을 받아들여 요약 통계 정보를 반환해야 합니다.스태틱 부트스트랩 콜에서는 적절한 평균 인터벌 길이를 지정해야 합니다.
적용들
교차 검증을 사용하여 여러 예측 모형화 절차의 성능을 비교할 수 있습니다.예를 들어 광학식 문자 인식에 관심이 있으며 Support Vector Machine(SVM) 또는 KNN(k-nearest neighbors) 중 하나를 사용하여 손으로 쓴 문자의 이미지에서 실제 문자를 예측한다고 가정합니다.교차 검증을 사용하여, 우리는 잘못 분류된 문자의 각각의 분율 측면에서 이 두 가지 방법을 객관적으로 비교할 수 있었다.단순히 표본 내 오류율에 따라 방법을 비교한다면, 한 방법이 다른 방법에 비해 더 유연하고 따라서[citation needed] 과적합 경향이 높기 때문에 더 나은 성능을 발휘하는 것으로 보일 수 있다.
교차 검증은 변수 [33]선택에서도 사용할 수 있습니다.암 환자가 약물에 반응할지 여부를 예측하기 위해 20개의 단백질의 발현 수준을 사용한다고 가정합니다.실제 목표는 최적의 예측 모델을 생성하기 위해 20가지 특징 중 어떤 부분 집합을 사용해야 하는지를 결정하는 것입니다.대부분의 모델링 절차에서 샘플 내 오류율을 사용하여 피쳐 서브셋을 비교하면 20개의 피쳐를 모두 사용할 때 최고의 퍼포먼스가 나타납니다.그러나 교차 검증에서는 일반적으로 최적 적합 모형이 진정으로 유용한 것으로 간주되는 기능의 부분 집합만 포함됩니다.
의료 통계학의 최근 발전은 메타 분석에서의 사용이다.이는 메타분석 [34]요약 추정치의 통계적 타당성을 테스트하는 데 사용되는 검증 통계량 Vn의 기초를 형성한다.또한 메타 분석 [35]결과의 예측 오류를 추정하기 위해 메타 분석에서 보다 전통적인 의미로 사용되어 왔다.
「 」를 참조해 주세요.
주 및 참고 자료
- ^ Piryonesi S. Madeh; El-Diraby Tamer E. (2020-03-01). "Data Analytics in Asset Management: Cost-Effective Prediction of the Pavement Condition Index". Journal of Infrastructure Systems. 26 (1): 04019036. doi:10.1061/(ASCE)IS.1943-555X.0000512. S2CID 213782055.
- ^ Allen, David M (1974). "The Relationship between Variable Selection and Data Agumentation and a Method for Prediction". Technometrics. 16 (1): 125–127. doi:10.2307/1267500. JSTOR 1267500.
- ^ Stone, M (1974). "Cross-Validatory Choice and Assessment of Statistical Predictions". Journal of the Royal Statistical Society, Series B (Methodological). 36 (2): 111–147. doi:10.1111/j.2517-6161.1974.tb00994.x. S2CID 62698647.
- ^ Stone, M (1977). "An Asymptotic Equivalence of Choice of Model by Cross-Validation and Akaike's Criterion". Journal of the Royal Statistical Society, Series B (Methodological). 39 (1): 44–47. doi:10.1111/j.2517-6161.1977.tb01603.x. JSTOR 2984877.
- ^ Geisser, Seymour (1993). Predictive Inference. New York, NY: Chapman and Hall. ISBN 978-0-412-03471-8.
- ^ a b Kohavi, Ron (1995). "A study of cross-validation and bootstrap for accuracy estimation and model selection". Proceedings of the Fourteenth International Joint Conference on Artificial Intelligence. San Mateo, CA: Morgan Kaufmann. 2 (12): 1137–1143. CiteSeerX 10.1.1.48.529.
- ^ Devijver, Pierre A.; Kittler, Josef (1982). Pattern Recognition: A Statistical Approach. London, GB: Prentice-Hall. ISBN 0-13-654236-0.
- ^ Galkin, Alexander (November 28, 2011). "What is the difference between test set and validation set?". Retrieved 10 October 2018.
- ^ "Newbie question: Confused about train, validation and test data!". Archived from the original on 2015-03-14. Retrieved 2013-11-14.
{{cite web}}: CS1 maint: bot: 원래 URL 상태를 알 수 없습니다(링크). - ^ Cawley, Gavin C.; Talbot, Nicola L. C. (2010). "On Over-fitting in Model Selection and Subsequent Selection Bias in Performance Evaluation" (PDF). 11. Journal of Machine Learning Research: 2079–2107.
{{cite journal}}:Cite 저널 요구 사항journal=(도움말) - ^ Grossman, Robert; Seni, Giovanni; Elder, John; Agarwal, Nitin; Liu, Huan (2010). "Ensemble Methods in Data Mining: Improving Accuracy Through Combining Predictions". Synthesis Lectures on Data Mining and Knowledge Discovery. Morgan & Claypool. 2: 1–126. doi:10.2200/S00240ED1V01Y200912DMK002.
- ^ Trippa, Lorenzo; Waldron, Levi; Huttenhower, Curtis; Parmigiani, Giovanni (March 2015). "Bayesian nonparametric cross-study validation of prediction methods". The Annals of Applied Statistics. 9 (1): 402–428. arXiv:1506.00474. Bibcode:2015arXiv150600474T. doi:10.1214/14-AOAS798. ISSN 1932-6157. S2CID 51943497.
- ^ Celisse, Alain (1 October 2014). "Optimal cross-validation in density estimation with the $L^{2}$-loss". The Annals of Statistics. 42 (5): 1879–1910. arXiv:0811.0802. doi:10.1214/14-AOS1240. ISSN 0090-5364. S2CID 17833620.
- ^ Airola, A.; Pahikkala, T.; Waegeman, W.; De Baets, Bernard; Salakoski, T. (2011-04-01). "An experimental comparison of cross-validation techniques for estimating the area under the ROC curve". Computational Statistics & Data Analysis. 55 (4): 1828–1844. doi:10.1016/j.csda.2010.11.018.
- ^ Molinaro, A. M.; Simon, R.; Pfeiffer, R. M. (2005-08-01). "Prediction error estimation: a comparison of resampling methods". Bioinformatics. 21 (15): 3301–3307. doi:10.1093/bioinformatics/bti499. ISSN 1367-4803. PMID 15905277.
- ^ McLachlan, Geoffrey J.; Do, Kim-Anh; Ambroise, Christophe (2004). Analyzing microarray gene expression data. Wiley.
- ^ "Elements of Statistical Learning: data mining, inference, and prediction. 2nd Edition". web.stanford.edu. Retrieved 2019-04-04.
- ^ Vanwinckelen, Gitte (2 October 2019). On Estimating Model Accuracy with Repeated Cross-Validation. lirias.kuleuven. pp. 39–44. ISBN 9789461970442.
- ^ "Cross Validation". Retrieved 11 November 2012.
- ^ Arlot, Sylvain; Celisse, Alain (2010). "A survey of cross-validation procedures for model selection". Statistics Surveys. 4: 40–79. arXiv:0907.4728. doi:10.1214/09-SS054. S2CID 14332192.
In brief, CV consists in averaging several hold-out estimators of the risk corresponding to different data splits.
- ^ Dubitzky, Werner; Granzow, Martin; Berrar, Daniel (2007). Fundamentals of data mining in genomics and proteomics. Springer Science & Business Media. p. 178.
- ^ Kuhn, Max; Johnson, Kjell (2013). Applied Predictive Modeling. New York, NY: Springer New York. doi:10.1007/978-1-4614-6849-3. ISBN 9781461468486.
- ^ 칸츨러, H. "랜덤 표본 컨센서스(트랜스ac)"에든버러 대학 정보학부 지각, 행동 및 행동 연구소(1981년).http://citeseerx.ist.psu.edu/viewdoc/download?doi=10.1.1.106.3035&rep=rep1&type=pdf
- ^ a b c Hoornweg, Victor (2018). Science: Under Submission. Hoornweg Press. ISBN 978-90-829188-0-9.
- ^ Christensen, Ronald (May 21, 2015). "Thoughts on prediction and cross-validation" (PDF). Department of Mathematics and Statistics University of New Mexico. Retrieved May 31, 2017.
- ^ a b Efron, Bradley; Tibshirani, Robert (1997). "Improvements on cross-validation: The .632 + Bootstrap Method". Journal of the American Statistical Association. 92 (438): 548–560. doi:10.2307/2965703. JSTOR 2965703. MR 1467848.
- ^ Stone, Mervyn (1977). "Asymptotics for and against cross-validation". Biometrika. 64 (1): 29–35. doi:10.1093/biomet/64.1.29. JSTOR 2335766. MR 0474601.
- ^ Consortium, MAQC (2010). "The Microarray Quality Control (MAQC)-II study of common practices for the development and validation of microarray-based predictive models". Nature Biotechnology. London: Nature Publishing Group. 28 (8): 827–838. doi:10.1038/nbt.1665. PMC 3315840. PMID 20676074.
- ^ Bermingham, Mairead L.; Pong-Wong, Ricardo; Spiliopoulou, Athina; Hayward, Caroline; Rudan, Igor; Campbell, Harry; Wright, Alan F.; Wilson, James F.; Agakov, Felix; Navarro, Pau; Haley, Chris S. (2015). "Application of high-dimensional feature selection: evaluation for genomic prediction in man". Sci. Rep. 5: 10312. Bibcode:2015NatSR...510312B. doi:10.1038/srep10312. PMC 4437376. PMID 25988841.
- ^ Varma, Sudhir; Simon, Richard (2006). "Bias in error estimation when using cross-validation for model selection". BMC Bioinformatics. 7: 91. doi:10.1186/1471-2105-7-91. PMC 1397873. PMID 16504092.
- ^ Bergmeir, Christopher; Benitez, Jose (2012). "On the use of cross-validation for time series predictor evaluation". Information Sciences. 191: 192–213. doi:10.1016/j.ins.2011.12.028 – via Elsevier Science Direct.
- ^ Politis, Dimitris N.; Romano, Joseph P. (1994). "The Stationary Bootstrap". Journal of the American Statistical Association. 89 (428): 1303–1313. doi:10.1080/01621459.1994.10476870. hdl:10983/25607.
- ^ Picard, Richard; Cook, Dennis (1984). "Cross-Validation of Regression Models". Journal of the American Statistical Association. 79 (387): 575–583. doi:10.2307/2288403. JSTOR 2288403.
- ^ Willis BH, Riley RD (2017). "Measuring the statistical validity of summary meta-analysis and meta-regression results for use in clinical practice". Statistics in Medicine. 36 (21): 3283–3301. doi:10.1002/sim.7372. PMC 5575530. PMID 28620945.
- ^ Riley RD, Ahmed I, Debray TP, Willis BH, Noordzij P, Higgins JP, Deeks JJ (2015). "Summarising and validating test accuracy results across multiple studies for use in clinical practice". Statistics in Medicine. 34 (13): 2081–2103. doi:10.1002/sim.6471. PMC 4973708. PMID 25800943.