영향평가

Impact evaluation

영향 평가는 프로젝트, 프로그램 또는 정책과 같은 특정 개입에 기인할 수 있는 변경사항과 의도하지 않은 변경사항 및 이상적인 변경사항을 평가한다.[1] 목표 달성 여부를 검토하는 결과 모니터링과는 반대로, 영향 평가는 개입이 수행되지 않았다면 참가자의 복지와 같은 결과가 어떻게 달라졌을까라는 질문에 답하도록 구성된다. 여기에는 반사실적 분석, 즉 "실제 일어난 일과 개입이 없었더라면 일어났을 일의 비교"[2]가 포함된다. 영향 평가는 인과관계 질문에 대한 답을 찾고 있다. 즉, 프로그램의 직접적인 원인이 되는 결과의 변화를 모색한다.[3]

영향 평가는 사람들이 증거 기반의 정책 입안에 대한 핵심 질문에 대답하는데 도움이 된다: 무엇이 효과가 있는가, 없는가, 어디에, 왜, 얼마에 해당하는가? 그것은 최근 몇 년 동안 선진국과 개발도상국 모두의 맥락에서 정책 수립에 있어 점점 더 많은 관심을 받고 있다.[4] 그것은 평가 도구와 접근법의 무기고의 중요한 구성요소로서 생활 수준 향상에 있어 원조 전달과 공공 지출의 효과를 향상시키기 위한 세계적인 노력에 필수적이다. 원래 개발도상국의 사회 부문 프로그램, 특히 조건부 현금 이전을 평가하는 데 더 중점을 두었던 영향 평가는 농업, 에너지, 교통과 같은 다른 분야에서 점점 더 많이 적용되고 있다.

반사실적 평가 설계

반사실적 분석을 통해 평가자는 개입과 결과 사이에 원인과 결과를 설명할 수 있다. '반사실적'은 개입이 없을 때 수혜자에게 어떤 일이 일어났을지를 측정하며, 개입에 따라 관찰된 결과와 반사실적 결과를 비교하여 영향을 추정한다. 영향 평가의 주요 난제는 역효과를 직접 관측할 수 없으며 비교 그룹을 참조하여 근사치를 추정해야 한다는 것이다. 사전 (ex ante) 또는 소급 (ex post) 평가 설계를 사용하여 반사실적 분석에 적합한 비교 그룹을 결정하는 데는 다양한 허용 접근법이 있다. 사전 평가는 개입 설계 단계에서 시작되며, 개입 수혜자('처리 그룹')와 비 수혜자('비교 그룹')의 기준 및 엔드라인 데이터 수집을 포함하며, 개인 또는 커뮤니티를 치료 및 비교 그룹에 포함시킬 수 있다. 소급 평가는 일반적으로 구현 단계 이후에 수행되며, 비록 최선의 평가는 가능한 한 기준선에 가까운 데이터를 수집하지만, 개입과 비교 그룹의 비교 가능성을 보장하기 위해 기존 조사 데이터를 이용할 수 있다.

엄격한 영향 평가가 다루어야 하는 내부 타당성(연구 설계)과 외부 타당성(일반성)과 관련된 5가지 핵심 원칙이 있다: 교란 요인, 선택 편향, 유출 효과, 오염 및 충격 이질성.[5]

  • 교란 요인은 전형적으로 사회경제적 지위와 관련된 특정 요소들이 개입에 대한 노출과 상관관계가 있고 노출과 무관하게 관심의 결과와 인과관계가 있는 경우에 발생한다. 그러므로 교란 요인은 개입과 결과 사이의 관찰된 (아마도 가상적인) 관계에 대한 대체적인 설명이다.
  • 선택 편향은 특별한 교란 사례로서, 개입 참여자가 수혜자 모집단에서 무작위로 도출되고, 선택을 결정하는 기준이 결과와 상관관계가 있는 경우에 발생한다. 간섭에 대한 접근이나 참여와 관련되고, 관심의 결과와 인과관계가 있는, 관찰되지 않은 요인은 설명되지 않은 경우 개입과 결과 사이의 거짓 관계를 초래할 수 있다. 예를 들어, 더 나은 관심 결과를 가질 가능성이 더 높은, 더 능력 있거나 조직화된 개인이나 지역사회가 개입에 참여할 가능성이 더 높은 경우에 자기 선택이 발생한다. 내생적 프로그램 선택은 개인이나 공동체가 개입의 혜택을 받을 가능성이 더 높은 것으로 보이기 때문에 참여하도록 선택되는 경우에 발생한다. 교란 요인을 무시하면 누락된 변수 치우침 문제가 발생할 수 있다. 선택편향의 특별한 경우, 선택변수의 내실성은 동시성 편향을 일으킬 수 있다.
  • 스필오버(실험 평가의 경우 전염이라고 함)는 비교(제어) 그룹의 구성원이 개입의 영향을 받았을 때 발생한다.
  • 오염은 치료 및/또는 비교 그룹의 구성원이 관심 결과에 영향을 미치는 다른 개입에 접근할 때 발생한다.
  • 영향 이질성은 수혜자 유형과 맥락에 따른 영향의 차이를 말한다. 고품질 영향 평가는 서로 다른 집단(예: 취약계층)이 개입으로부터 이익을 얻는 정도뿐만 아니라 영향에 대한 맥락의 잠재적 영향을 평가한다. 결과를 일반화할 수 있는 정도는 다른 맥락에서 개입에 대해 학습한 교훈의 적용 가능성을 결정할 것이다.

영향 평가 설계는 반사실적 생성에 사용되는 방법의 유형에 따라 식별되며, 크게 세 가지 범주의 실험 설계, 준 실험 설계 및 비실험 설계로 분류할 수 있으며, 이 세 가지 범주는 타당성, 비용, 설계 중 또는 설계 이행 단계 중 관여 및 선택 정도에 차이가 있다. 편향. 백색([6]2006)과 라발리온(2008)[7]은 대체 영향 평가 접근법을 논의한다.

실험적 접근법

실험 평가에서 치료와 비교 그룹은 무작위로 선택되고 관심 결과에 영향을 미칠 수 있는 개입뿐만 아니라 개입으로부터 격리된다. 이러한 평가 설계를 무작위 제어 시험(RCT)이라고 한다. 실험 평가에서 비교 그룹을 대조군이라고 한다. 간섭에 의해 전염되지 않고 충분히 큰 표본에 대해 무작위화가 수행될 때 평균적으로 치료 집단과 대조군 집단의 유일한 차이는 후자가 개입을 받지 않는다는 것이다. 평가를 위한 표본을 무작위로 선택하는 무작위 표본 조사는 처리를 무작위로 할당해야 하는 실험 평가 설계와 혼동해서는 안 된다.

실험적인 접근방식은 종종 평가의 '금본위제'로 보류된다. 개입과 결과 사이의 인과관계를 입증하는 데 있어 선택 편향을 결정적으로 설명할 수 있는 유일한 평가 설계다. 개입으로부터의 임의화와 격리는 사회 정책의 영역에서 실행 불가능할 수 있고 자연 실험을 이용할 기회가 있을 수 있지만 윤리적으로 방어하기 어려울 수 있다.[8] Bamberger와 White(2007)는 개발 개입에 RCT를 적용하기 위한 몇 가지 한계를 강조한다.[9] 방법론적 비판은 스크리븐([10]2008)이 사회 개입을 완전히 눈감아 줄 수 없기 때문에 도입된 편견을 근거로 한 것이며, 디튼(2009)[11]은 실제로 RCT의 분석은 그들이 회피하고자 하는 회귀 기반 접근방식에 역행하기 때문에 동일한 잠재적 편견을 가질 수 있다고 지적했다. 다른 문제들로는 종종 이질적이고 변화하는 개입 상황, 물류 및 실무적 도전, 서비스 제공 모니터링의 어려움, 비교 그룹에 의한 개입에 대한 접근, 선택 기준의 변경 및/또는 시간의 경과에 따른 개입이 포함된다. 따라서, RCT는 개발 금융의 5%에만 적용되는 것으로 추정된다.[9]

무작위 제어 시험(RCT)

RCTs는 새로운 개입의 효과를 측정하기 위해 사용되는 연구들이다. 그들은 스스로 인과관계를 증명할 것 같지 않지만, 무작위화는 인과관계를 조사하는 도구를 제공하면서 편견을 감소시킨다.[12] RCTs는 무작위 할당에 의존한다. 즉, 프로젝트의 자연적인 할당을 무작위로 하는 경우는 드물기 때문에 평가는 거의 항상 예외적으로 설계되어야 한다.[13] RCT를 설계할 때 다음과 같은 5가지 핵심 질문을 해야 한다. 어떤 치료법을 시험하고 있는지, 치료 팔의 개수를 얼마로 할 것인지, 할당 단위를 얼마로 할 것인지, 샘플의 크기가 얼마나 필요한지, 어떻게 무작위 검사를 할 것인지.[13] 잘 수행된 RCT는 한 특정 모집단 또는 할당 단위 내에서 평균 치료 효과에 대한 신뢰할 수 있는 추정치를 산출할 것이다.[14] RCT의 단점은 '교통 문제'인데, 이는 한 모집단 내에서 작용하는 것이 반드시 다른 모집단 내에서 작용하는 것은 아니라는 것을 의미하며, 이는 평균 치료 효과가 서로 다른 할당 단위에 적용될 수 없다는 것을 의미한다.[14]

자연실험

자연 실험은 이러한 방법들이 통제되지 않는 장과 통제되는 실험실 데이터 수집 접근방식을 완화시키기 때문에 사용된다.[15] 자연 실험은 연구자와 피실험자의 통제 밖에 있는 사건을 활용하여 교란 요소들의 가능성을 최소화하면서, 보다 자연적인 치료 효과 범위와 유기적으로 형성된 맥락의 존재와 같은 현장 데이터의 특성 중 몇 가지를 희생시킨다.[15] 자연 실험의 주요 문제는 복제성의 문제다. 실험실 작업은 적절히 설명되고 반복될 때 유사한 결과를 산출할 수 있어야 한다. 자연 실험의 고유성 때문에 복제는 유사한 사건의 대체 데이터 분석으로 한정되는 경우가 많다.[15]

비실험적 접근법

준실험설계

준실험적 접근방식은 관측 가능성과 패널 데이터를 사용할 수 있는 경우 시간 불변 비관측가능성에 대한 선택에서 발생하는 편견을 제거할 수 있다. 준 실험 방법에는 일치, 차이점화, 기악 변수 및 파이프라인 접근법이 포함되며, 일반적으로 다변량 회귀 분석에 의해 수행된다.

선택 특성을 알고 관찰할 경우 편향 제거를 위해 조절할 수 있다. 매칭은 관찰된 선택 특성에 따라 프로그램 참가자와 비참여자를 비교하는 것이다. 성향 점수 매칭(PSM)은 통계적 모델을 사용하여 관측 가능한 특성 집합에 근거하여 참가 확률을 계산하고, 확률 점수가 유사한 참가자와 비참여자를 일치시킨다. 회귀 불연속성 설계는 이 컷오프의 어느 한 쪽에만 대한 결과를 비교하기 위한 개입을 누가 하고 받지 않는지에 대한 의사결정 규칙을 이용한다.

간섭 및 비교 그룹에 대해 기준선과 엔드라인에서 수집된 데이터를 사용하는 차이 또는 이중 차이의 차이는 선택 결정을 내리는 관측할 수 없는 요인이 시간에 따라 고정된다는 가정 하에 선택 편향을 설명하는 데 사용될 수 있다(시간 불변).

계측 변수 추정은 선택과 상관되지만 결과는 상관없는 요인('계기')을 사용하여 참여도를 모델링함으로써 선택 편향을 설명하므로 외생적으로 취급할 수 있는 프로그램 참여의 측면을 분리한다.

파이프라인 접근방식(스텝 웨지 설계)은 이미 프로젝트 참여 후기 단계에서 선택된 수혜자를 비교 그룹으로 사용한다. 그 가정은 미래에 개입을 받도록 선택되었기 때문에 치료 그룹과 유사하며, 따라서 관심의 결과 변수 측면에서 비교가능하다는 것이다. 그러나 실제로 치료와 비교 집단이 비교가능하다고 보장할 수 없으며 비교가능성을 검증하기 위해 어떤 매칭 방법을 적용할 필요가 있을 것이다.

비실험설계

비실험적 영향평가는 개입에 접근할 수 없는 비교집단을 수반하지 않기 때문에 이른바 '비실험적 영향평가'라고 할 수 있다. 비실험적 평가에 사용되는 방법은 개입의 실시 전후에 개입 집단을 비교하는 것이다. 개입 중단 시간 시리즈(ITS) 평가에는 개입 전후에 처리된 개인에 대한 다중 데이터 포인트가 필요한 반면, (또는 테스트 후 사전 테스트) 설계는 단순히 전후의 단일 데이터 포인트가 필요하다. 시험 후 분석에는 개입 그룹의 개입 이후 데이터만 포함된다. 비실험 설계는 가장 약한 평가 설계로, 개입과 결과 사이의 인과 관계를 설득력 있게 보여주기 위해, 평가는 결과에 대한 가능한 대체 설명이 관련이 없음을 입증해야 하기 때문이다. 그러나, 예를 들어 편의 시설에 대한 접근을 개선하는 개입으로 인한 시간 절약을 계산할 때, 이 설계가 관련되는 애플리케이션은 남아 있다. 또한, 보편적으로 시행되는 프로그램이나 국가 정책 개혁과 같이 비실험적 설계가 유일하게 실현 가능한 영향 평가 설계인 경우도 있을 수 있다.

프로그램 효과 추정의 편중

무작위화된 현장 실험은 프로그램 영향을 평가하기 위한 가장 강력한 연구 설계다. 이 특별한 연구 설계는 프로그램의 실제 효과를 공정하고 정확하게 추정할 수 있기 때문에 실현 가능한 경우 일반적으로 선택 설계라고 한다(Rossi, Lipsey & Freeman, 2004).

이렇게 말하면서 무작위화된 현장 실험이 항상 수행 가능한 것은 아니며 이러한 상황에서는 평가자가 대체 연구 설계가 있다. 그러나 중요한 문제는 평가자가 어떤 설계를 선택하든 공통적인 문제가 발생하기 쉽다는 것이다. 설계가 얼마나 잘 생각되거나 잘 구현되었는지에 관계없이, 각 설계는 프로그램 효과에 대한 편향된 추정치를 산출할 수 있다. 이러한 편견은 프로그램 효과를 과장하거나 감소시키는 역할을 한다. 그뿐만 아니라, 편향이 취할 수 있는 방향은 대개 사전에 알 수 없다(Rosi et al. 이러한 편견은 이해관계자의 이익에 영향을 미친다. 게다가, 편견이 비효율적이거나 해로운 프로그램을 효과적이게 보이도록 하는 데 기여한다면 프로그램 참여자들이 불이익을 받을 수 있다. 또한 편견이 효과적인 프로그램을 효과적이지 못하거나 심지어 해로운 것으로 보이게 할 가능성도 있다. 이것은 프로그램의 성과가 작거나 심지어 대수롭지 않게 보이게 할 수 있기 때문에 인원을 강제하고 심지어 프로그램의 후원자들이 프로그램에 대한 자금을 줄이거나 없애도록 할 수 있다(Rossi et al., 2004).

부적절한 설계가 편향을 야기할 경우, 프로그램의 자금후원을 주로 담당하는 이해관계자가 가장 우려되는 당사자가 될 것이라고 해도 무방하다. 평가 결과는 최종 결정이 기금 제공자와 후원자에게 있기 때문에 프로그램의 자금후원을 계속할 것인지 여부를 이해관계자가 결정하는 데 도움이 된다. 이해관계자는 대부분 관련될 뿐만 아니라 프로그램에 참여하거나 프로그램에 긍정적으로 영향을 미치려는 이해관계자는 선택한 설계와 선택한 설계에 의해 제공되는 결과에 영향을 받을 것이다. 따라서 평가자의 관심사는 프로그램 효과의 추정에서 편향의 양을 최소화하는 것이다(Rossi 등, 2004).

편향은 일반적으로 프로그램 노출로 결과를 측정하거나 프로그램 노출이 없었다면 어떤 결과가 되었을지 추정하는 두 가지 상황에서 볼 수 있다. 안타깝게도 영향 평가를 손상시킬 수 있는 모든 형태의 편견이 명백하지는 않다(Rosi et al., 2004).

영향 평가 설계의 가장 일반적인 형태는 프로그램을 수신하는 개입 그룹과 그렇지 않은 통제 그룹인 개인 또는 다른 장치의 두 그룹을 비교하는 것이다. 프로그램 효과의 추정치는 적절한 결과 측정치에 대한 그룹 간의 차이에 기초한다(Rossi et al., 2004). 프로그램 및 제어 그룹에 개인을 무작위로 할당하면 지속적인 동등성을 가정할 수 있다. 무작위화를 통해 형성되지 않은 집단 비교를 비등가 비교 설계라고 한다(Rosi 등, 2004).

선택편향

동등성 가정이 없는 경우, 프로그램 효과의 추정치에 상관 없이 발생하였을 그룹 간의 결과의 차이는 편향의 형태를 만든다. 이를 선택 바이어스(Rosi et al., 2004)라고 한다. 그것은 비등가 집단 비교 설계를 사용한 영향 평가에서 프로그램 효과 추정의 유효성에 대한 위협을 발생시키고, 완전히 알려지지 않은 영향을 담당하는 일부 프로세스가 순수 차이에 의해 결정되는 그룹에 대한 할당 대신에 어떤 개인이 어떤 그룹에 속할 것인지를 선택하는 상황에 나타난다.nce (Rossi et al., 2004) 이는 참가자의 자기 선택 때문일 수도 있고, 프로그램 배치(배치 편향) 때문일 수도 있다.[16]

선택 편향은 이미 형성된 중재 및 통제 그룹의 구성원에 대한 결과 데이터를 손실시키는 자연적이거나 의도적인 프로세스를 통해 발생할 수 있다. 이를 소모라고 하며 두 가지 방법으로 발생할 수 있다(Rosi et al., 2004): 중재 또는 통제 그룹에서 탈락하는 대상은 도달할 수 없거나, 결과 측정에서 협력하기를 거부한다. 명시적 우연 프로세스 이상의 결과로 소진이 발생할 경우 차등 소진을 가정한다(Rosi et al. 즉, "결과 데이터가 누락된 중재 그룹 출신 개인은 결과 데이터가 누락된 대조군 출신 개인과 동일한 결과 관련 특성을 갖는다고 가정할 수 없다"는 것이다(Rosi 등, 2004, p271). 그러나 무작위 할당 설계는 소모에 의해 유발되는 선택 편향으로부터 안전하지 않다(Rosi 등, 2004).

다른 형태의 치우침

영향 평가 결과에 편향을 일으킬 수 있는 다른 요소들이 있다. 이는 일반적으로 개입 중에 발생하는 프로그램을 수신하는 것 이외의 사건이나 경험과 관련이 있다. 이러한 편향에는 세속적 경향, 간섭적 사건 및 성숙도가 포함된다(Rosi et al., 2004).

세속적 경향 또는 세속적 표류

세속적인 경향은 공동체, 지역 또는 국가에서 비교적 장기적인 경향이라고 정의할 수 있다. 이러한 변화는 세속적 표류라고도 하며 개입의 명백한 영향을 강화하거나 숨기는 변화를 초래할 수 있다(Rossi et al., 2004). 예를 들어, 공동체의 출산율이 감소하고 있을 때, 출산율 감소 프로그램은 그러한 하향 추세에 기인하는 편견 때문에 효과적으로 보일 수 있다(Rosi 등, 2004, p273).

간섭 이벤트

간섭 이벤트는 세속적인 경향과 유사하다. 이 경우 정전사태가 통신을 방해하거나 식품 보충제의 전달을 방해하는 등 프로그램 효과의 추정치에 편향을 일으킬 수 있는 변화를 초래할 수 있는 단기 이벤트는 영양 프로그램을 방해할 수 있다(Rosi 등, 2004, p273).

성숙

영향 평가는 프로그램과는 독립적으로 자연적인 출산 및 개발 과정이 상당한 변화를 일으킬 수 있다는 사실을 수용할 필요가 있다. 프로그램 효과 추정치에 이러한 변화를 포함하면 편향 추정치가 나올 수 있다. 이러한 형태의 편향의 예는 성인들 사이의 예방적 건강 관행을 개선하기 위한 프로그램이 될 것이다. 왜냐하면 일반적으로 건강은 나이가 들면서 감소하기 때문이다(Rosi 등, 2004, p273).

"임의 할당과 결과 측정 사이의 프로그램 및 제어 그룹에 대해 비교 가능한 상황의 신중한 유지관리는 그룹에 대한 다른 미분 경험이나 사건의 영향으로부터 편향을 방지해야 한다. 이러한 조건 중 하나가 설계에 없을 경우 프로그램 효과의 추정치에 편향 가능성이 있다."(Rosi 등, 2004, p274).

추정 방법

추정 방법은 대체로 평가 설계에 따른다. 설계마다 다른 추정 방법을 사용하여 반사실적인 웰빙의 변화를 측정해야 한다. 실험 및 준실험 평가에서, 개입의 추정 영향은 치료 집단(중재를 받는 집단)과 대조군 또는 비교 집단(중재를 받지 않는 집단) 사이의 평균 결과의 차이로 계산된다. 이 방법을 무작위 제어 시험(RCT)이라고도 한다. 미국평가협회 전 대표 짐 러프와의 인터뷰에 따르면 이 방법은 복잡하고 다층적인 문제에는 통하지 않는다. 단일 차이 추정기는 엔드라인에서 평균 결과를 비교하며 치료와 대조군 그룹이 기준선에서 동일한 결과 값을 갖는 경우에 유효하다. 차이(또는 이중 차이) 추정기는 치료 및 비교 그룹에 대한 시간에 따른 결과 변화 차이를 계산하여, 개입을 시행한 후 두 그룹에 대해 기준선에서 수집된 데이터와 엔드라인에서 수집된 두 번째 데이터 라운드를 활용하며, 몇 년 후가 될 수 있다.[17]

수혜자 참여('준수' 또는 '성수'라고도 함)와 관계없이 치료 그룹의 평균 결과를 비교 그룹의 결과와 비교해야 하는 영향 평가를 치료의향(ITT) 분석이라고 한다. 치료 집단에 대한 개입을 준수하거나 준수하는 수혜자 간의 결과를 대조군 그룹의 결과와 비교하는 영향 평가를 치료(TOT) 분석이라고 한다. 따라서 ITT는 영향의 저한계 추정치를 제공하지만, 자발적 프로그램 분석에서 TOT보다 정책적 관련성이 높다는 것은 논란의 여지가 있다.[18]

토론

영향평가의 중요성에 대한 합의가 있고, 반사실적 평가 방법의 사용을 둘러싼 합의가 나타나고 있는 가운데, 최근 몇 년 동안 영향평가의 정의와 적절한 방법의 사용 둘 다에 대한 논의가 광범위하게 이루어지고 있다(개요는 2009년[19] 화이트 참조).

정의들

영향 평가를 위한 국제 이니셔티브(3ie)는 엄격한 영향 평가를 다음과 같이 정의한다: "조사 중인 평가 문제에 이용할 수 있고 실현 가능하며 적절한 방법론을 사용하여 특정 프로그램에 귀속될 수 있는 특정 그룹의 결과의 순변화를 측정하는 분석".구체적인 맥락"이라고 말했다.[20]

세계은행의 DIME 이니셔티브에 따르면, "영향평가에서는 프로그램이 없었다면 수혜자에게 어떤 일이 일어났을지 보여주는 반사실적 프로그램과 프로그램의 결과를 비교한다. 다른 형태의 평가와는 달리, 그들은 실험 및 준 실험 설계를 따름으로써 평가되는 프로그램에 대한 관찰된 결과 변경의 귀속화를 허용한다."[21]

마찬가지로 미국 환경보호청 영향평가에 따르면 프로그램 결과와 프로그램이 없을 경우 어떤 일이 일어났을지 추정치를 비교하여 프로그램의 순효과를 평가하는 평가 형식이다.[22]

세계은행 독립평가단(IEG)에 따르면 영향평가는 프로그램이나 프로젝트 등 주어진 개발활동으로 인한 개별 가구, 기관, 환경에 대한 긍정적 또는 부정적 영향을 체계적으로 파악하는 것이다.[23]

영향 평가는 지난 수십 년간 다르게 정의되어 왔다.[6] 영향 평가에 대한 다른 해석은 다음과 같다.

  • 프로젝트 결과물이 아닌 최종 복지 결과에 대한 개입의 영향을 검토하는 평가 또는 이행에 초점을 맞춘 프로세스 평가
  • 개입이 완료된 후 어느 정도(5~10년) 평가하여 영향이 나타날 수 있는 시간을 허용한다.
  • 주어진 분야 또는 지리적 영역 내의 모든 개입을 고려한 평가.

다른 저자들은 "영향평가"와 "영향평가"를 구별한다. "영향평가"는 개입의 효과와 그 통계적 중요성을 추정하기 위해 경험적 기법을 사용하는 반면, "영향평가"는 구조적 시뮬레이션과 확실한지 평가할 수 없는 다른 접근법을 포함하여 광범위한 방법을 포함한다.비논리적 의의 [16]중요성

평가에 사용되는 '영향'의 일반적인 정의는 일반적으로 삶의 질 결과에 대한 개입과 관련된 장기적 결과의 전체성을 의미한다. 예를 들어 경제협력개발기구 개발원조위원회(OECD-DAC)는 영향을 "직접적 또는 간접적으로 개발 개입에 의해 발생하는 긍정적, 부정적, 일차적, 2차적 장기적 영향"으로 정의한다.[24] 많은 국제 기관들도 이 영향의 정의를 채택했다. 예를 들어, 유니세프는 영향을 "기술, 경제, 사회 문화, 제도, 환경 또는 기타 프로그램(의도적이든 의도적이든 의도하지 않았든)의 장기적 결과"로 정의한다. 의도된 영향은 프로그램 목표에 부합해야 한다."[25] 마찬가지로, Evaluationwiki.org은 영향 평가를 정책, 지침 또는 서비스의 즉각적인 결과를 넘어 의도하지 않은 프로그램 효과뿐만 아니라 장기적 효과를 식별하는 평가로 정의한다.[26]

기술적으로, 평가는 반사실적 참조 없이 여기서 정의한 '영향'을 평가하기 위해 수행될 수 있다. 그러나 기존 문헌(예: 영향 평가에[27] 관한 NONIE 지침)의 상당 부분은 반사실적 분석에 기초하여 반드시 개입에 영향을 귀속시키는 데 사용되는 기법을 참조하면서 영향의 정의를 OECD-DAC에 채택한다.

'영향평가'라는 용어에서 빠진 것은 '영향평가'가 장기적으로 나타나는 방식이다. 예를 들어, 대부분의 모니터링 및 평가 '논리적 프레임워크' 계획에는 입력-출력 결과가 있고... 임팩트 처음 3개는 프로젝트 기간 동안 나타나는 반면, 영향이 발생하는데 훨씬 더 오래 걸린다. 예를 들어, 5년 농업 프로젝트에서, 씨앗은 투입물이고, 농부들은 우리의 생산물을 사용하는 훈련을 받았으며, 그 결과 씨앗이 적절하게 심어져서 농작물의 수확량의 변화는 시간이 지남에 따라 더욱 지속 가능한 식량을 확보하는 것이 영향을 미친다. 그러한 프로젝트 이후의 영향 평가는 매우 드물다. 그것들은 또한 사후 평가라고도 불리거나 우리는 지속적 영향 평가라는 용어를 사용하고 있다. 수십만 건의 문서들이 그들을 요구하지만, 기부자들이 얼마나 지속적이고 지속적인지, 그리고 자원이 철수된 후에도 우리의 개입이 얼마나 지속적이고 지속적이었는지를 보기 위해 자금 융통성 또는 관심을 갖는 경우는 드물다. 설계, 구현, M&E, 국가 소유권 육성 등을 위해 배워야교훈이 많다.

방법론적 논쟁

한편으로 실험적인 방법론 지지자들과 다른 한편으로 더 일반적인 방법론 지지자들 사이에서 영향 평가에 대한 적절한 방법론에 대한 학계의 집중적인 논쟁이 있다. William Easterly는 이것을 '개발경제학의 남북전쟁'이라고 불렀다. '랜도미스타'[8]라고도 불리는 실험 설계의 지지자들은 무작위화가 관측할 수 없는 선택 편향을 설명하기 위한 유일한 수단이며, 가냘픈 실험 근거 기반을 구축하는 것이 우선사항으로 개발되어야 한다고 주장한다.[28] 이와는 대조적으로, 다른 이들은 무작위 배정은 개발 개입에 거의 적절하지 않다고 주장하고 있으며, 심지어 그러한 경우에도 실험은 우리에게 특정 상황에 적용되는 특정 개입의 결과에 대한 정보를 제공하고 외부 관련성은 거의 제공하지 않는다고 주장한다.[29] 일부 기부자와 학계에서는 영향평가에 지나치게 강조해 사실상 학습과 책임성을 저해할 수 있다는 비판이 평가기관 등으로부터 제기돼 왔다.[30][31] 또한, 영향 평가 내에서 질적 방법에 대한 적절한 역할에 대한 논쟁이 있었다.[32][33]

이론 기반 영향 평가

효과에 대한 지식도 중요하지만, 효과의 이유와 결과가 복제될 가능성이 높은 상황을 이해하는 것도 중요하다. 치료와 비교 그룹 간의 결과의 차이만을 보고하는 '블랙박스' 영향 평가 접근방식과 대조적으로, 이론 기반 영향 평가는 입력에서 결과 및 영향까지의 인과 사슬을 매핑하고 기초적인 가정을 시험하는 것을 포함한다.[34][27] 공공정책 영역 내의 대부분의 개입은 강압적(법적으로 요구되는) 성격이 아니라 자발적인 성격이다. 또한, 개입은 수동적이기 보다는 능동적이기 때문에 수혜자간의 참여도가 낮기 보다는 더 큰 정도가 필요하며 따라서 행동변화는 효과성의 선행조건으로 작용한다. 따라서 공공 정책은 사람들이 그들의 행동을 호의적으로 바꾸도록 장려되는 정도까지 성공할 것이다. 이론 기반 접근방식은 정책 입안자들이 프로그램 참여 수준이 다른 이유('준수' 또는 '준수'라고 함)와 행동 변화를 결정하는 프로세스를 이해할 수 있게 한다. 이론 기반 접근법은 양적 데이터 수집과 질적 데이터 수집을 모두 사용하며, 후자는 준수 이유와 따라서 개입이 다른 환경에서 복제되는지 여부와 방법을 이해하는 데 특히 유용할 수 있다. 정성적 자료수집 방법으로는 초점그룹, 심층면접, 참여형 농촌평가(PRA), 현장방문 등이 있으며, 인류학 및 정치문학 독서 등이 있다.

White(2009b)[34]는 영향 평가의 정책 관련성을 개선하기 위한 수단으로서 영향 평가에 대한 이론 기반 접근법의 보다 광범위한 적용을 지지하며, 이론 기반 접근법의 6가지 핵심 원칙을 설명한다.

  1. 개입이 의도된 결과로 이어질 것으로 예상되는 방법을 설명하는 인과관계(프로그램 이론)를 설계하고, 데이터를 수집하여 인과관계의 기초적인 가정을 시험한다.
  2. 개입의 사회적, 정치적, 경제적 설정을 포함한 맥락을 이해한다.
  3. 이질성을 예측하여 하위 그룹을 식별하고 분석에 사용될 세분화 수준을 고려하도록 표본 크기를 조정한다.
  4. 신뢰할 수 있는 반사실적 요소를 이용한 충격의 엄격한 평가(위에서 논의한 바와 같이).
  5. 인과 사슬의 링크에 대한 엄격한 사실 분석.
  6. 혼합 방법(양적 방법과 질적 방법의 조합)을 사용한다.

실험영향평가 방법론은 1980년대 이후 개발도상국의 영양과 물, 위생 개입을 평가하는 데 사용되어 왔으나, 대규모 개발 프로그램에 대한 실험 방법의 적용은 조건부 현금 이전(CCT) 프로그램 프로그레사(현재의 calle)의 평가다.d Oportunidades) 멕시코에서 학교 교육, 면역율, 아동 노동 등 다양한 개발 결과를 조사했다.[35][36] 이후 CCT 프로그램은 중남미 등의 여러 정부에 의해 실시되었으며, 2009년 2월 세계은행이 발표한 보고서는 20개국에 걸친 CCT의 영향을 조사한다.[37]

최근에는 사회적, 생산적 부문에 걸친 광범위한 개입에 영향 평가가 적용되고 있다. 3ie는 저소득 및 중산층 국가에서 수행된 연구를 포함하는 영향 평가의 온라인 데이터베이스를 시작했다. 영향 평가를 발간하는 다른 기관들에는 빈곤 퇴치를 위한 혁신, 세계 은행의 DIME 이니셔티브, NONIE 등이 있다. 세계은행의 IEG는 지난 20년간 수행된 다양한 분야의 개발 프로그램에 대한 10가지 영향 평가의 경험을 체계적으로 평가하고 요약했다.[38]

개발 개입의 영향 평가를 촉진하는 조직

2006년, 평가 격차 워킹그룹은[39] 개발 개입에 관한 증거의 큰 격차, 특히 저소득 및 중산층의 엄격한 영향 평가를 위해 자금을 지원하고 옹호함으로써 격차를 억제할 수 있는 독립된 기구를 설립할 것을 주장하였다. 보고서에 대한 대응으로 국제 영향 평가 이니셔티브(3ie)가 설정되었다. 3ie는 무엇이 효과가 있는지, 언제, 왜, 얼마에 해당하는지에 대한 증거를 제공하고 요약함으로써 저소득 및 중산층의 가난한 사람들의 삶을 개선하고자 한다. 3ie는 보조금 프로그램, 중저소득 국가에서 자금조달 영향 연구, 새로운 증거가 나타나면서 갱신되는 기존 증거에 대한 종합 검토 등을 운영하고 있으며, 품질보증 서비스를 통해 품질 영향 평가를 지원한다.

영향 평가에 전념하는 또 다른 이니셔티브는 지속가능성 평가 위원회(COSA)이다. COSA는 국제 지속가능개발연구원(IISD) 지속가능상품 이니셔티브, 국제연합무역개발회의(UNCTAD), 국제연합무역센터(ITC)와 제휴하여 유지되는 비영리 글로벌 기관 컨소시엄이다. COSA는 농업 관행, 특히 특정 지속가능성 프로그램(유기농, 공정무역 등)의 시행과 관련된 사회적, 환경적, 경제적 영향을 분석하기 위한 독립적인 측정 도구를 개발하고 적용하고 있다. 농업인, 정책입안자, 산업계가 서로 다른 농작물이나 농업부문과의 지속가능성을 이해하고 개선하기 위해 사용할 수 있는 글로벌 지표와 측정 도구를 확립하는 것이 시책의 초점이다. COSA는 주어진 지속가능성 이니셔티브에 참여함으로써 상대적 비용과 편익을 정확하게 계산할 수 있도록 함으로써 이를 촉진하는 것을 목표로 한다.

빈곤행동 혁신, 세계은행 전략영향평가기금(SIEF), 세계은행 개발영향평가(DIME) 이니셔티브, CGIAR의 제도적 학습 변화(ILAC) 이니셔티브, 네트워크 등 세계적으로 영향평가를 촉진하기 위한 많은 추가 기구가 설립되었다.NONIE(Networks on Impact Evaluation, NONIE)의 네트워크

영향 증거에 대한 체계적 검토

다양한 조직들이 체계적인 검토의 제작을 조정하기 위해 노력하고 있다. 체계적 검토는 특정 주제에 대한 기존 증거의 범위를 평가하고, 접근 가능한 형식으로 정보를 제시함으로써 연구 정책 격차를 해소하는 것을 목표로 한다. 엄격한 영향 평가와 마찬가지로, 그것들은 선행 연구 포함, 검색 및 합성 방법에 대한 기준을 제시하는 연구 프로토콜로부터 개발된다. 체계적 검토에는 다섯 가지 주요 단계가 포함된다. 즉, 포함될 중재, 모집단, 결과 및 연구 설계의 결정, 출판 및 미발표 문헌을 식별하기 위한 검색, 연구 프로토콜에 명시된 연구 포함 기준(중재, 모집단, 결과 및 연구 설계와 관련), 정보의 부호화.연구 결과, 숲 그림을 사용한 개입 효과에 대한 정량적 추정치 제시 및 적절한 균일성으로 중재안이 결정된 경우 메타분석을 사용한 통합 요약 추정치의 계산; 마지막으로, 새로운 증거가 등장함에 따라 체계적인 검토가 주기적으로 업데이트되어야 한다. 체계적 검토는 예를 들어 개입 효과의 장벽 또는 촉진자와 관련된 질적 정보의 통합도 포함할 수 있다.

참고 항목

참조

  1. ^ 영향평가 세계은행 빈곤층 2008년 1월 6일 접속
  2. ^ 흰색, H.(2006) 충격 평가: 워싱턴 D.C. 3 페이지 세계은행 독립평가단의 경험
  3. ^ "Gertler, Martinez, Premand, Rawlings and Vermeersch (2011) Impact Evaluation in Practice, Washington, DC:The World Bank". Archived from the original on 2011-07-17. Retrieved 2010-12-15.
  4. ^ "Log in" (PDF). Retrieved 16 January 2017.
  5. ^ "Log in" (PDF). Retrieved 16 January 2017.
  6. ^ Jump up to: a b 흰색, H.(2006) 충격 평가: 워싱턴 D.C. 세계은행 독립평가단의 경험
  7. ^ 라발리온, M. (2008) 빈곤 퇴치 프로그램 평가
  8. ^ Jump up to: a b Martin, Ravallion (1 January 2009). "Should the Randomistas Rule?". 6 (2): 1–5. Retrieved 16 January 2017 – via RePEc - IDEAS. Cite 저널은 필요로 한다. journal= (도움말)
  9. ^ Jump up to: a b Bamberger, M. and White, H.(2007) 개발도상국에서 강력한 평가 설계 사용: 경험과 과제, 다학제 평가 저널, 제4권, 제8권, 58-73권
  10. ^ Scriven (2008) RCT 방법론의 종합평가: & 인과 연구에 대한 대안적 접근, 다학제 평가 저널 5, 9권, 11-24
  11. ^ Deaton, Angus (1 January 2009). "Instruments of Development: Randomization in the Tropics, and the Search for the Elusive Keys to Economic Development". SSRN 1335715. Cite 저널은 필요로 한다. journal= (도움말)
  12. ^ Hariton, Eduardo; Locascio, Joseph J. (December 2018). "Randomised controlled trials—the gold standard for effectiveness research". BJOG: An International Journal of Obstetrics and Gynaecology. 125 (13): 1716. doi:10.1111/1471-0528.15199. ISSN 1470-0328. PMC 6235704. PMID 29916205.
  13. ^ Jump up to: a b White, Howard (8 March 2013). "An introduction to the use of randomised control trials to evaluate development interventions" Check url= value (help). Journal of Development Effectiveness. 5: 30–49. doi:10.1080/19439342.2013.764652. S2CID 51812043 – via Taylor and Francis.
  14. ^ Jump up to: a b Deaton, Angus; Cartwright, Nancy (2016-11-09). "The limitations of randomised controlled trials". VoxEU.org. Retrieved 2020-10-26.
  15. ^ Jump up to: a b c Roe, Brian E.; Just, David R. (December 2009). "Internal and External Validity in Economics Research: Tradeoffs between Experiments, Field Experiments, Natural Experiments, and Field Data". American Journal of Agricultural Economics. 91 (5): 1266–1271. doi:10.1111/j.1467-8276.2009.01295.x. ISSN 0002-9092.
  16. ^ Jump up to: a b White, Howard; Raitzer, David (2017). Impact Evaluation of Development Interventions: A Practical Guide (PDF). Manila: Asian Development Bank. ISBN 978-92-9261-059-3.
  17. ^ Rugh, Jim (June 22, 2012). "Hammer in search of nails". D+C Development and Cooperation. 2012 (7): 300.
  18. ^ Bloom, H. (2006) 사회 연구를 위한 무작위 실험의 핵심 분석. MDRC 연구 방법론에 대한 작업 보고서. MDRC, 뉴욕
  19. ^ "White, H. (2009) Some reflections on current debates in impact evaluation, Working paper 1, International Initiative for Impact Evaluation, New Delhi". Archived from the original on 2013-01-08. Retrieved 2012-10-29.
  20. ^ "Log in" (PDF). Retrieved 16 January 2017.
  21. ^ 세계은행(nd) 개발 IMPact 평가(DIME) 이니셔티브, 프로젝트 문서, World Bank, Washington D.C.
  22. ^ 2008년 1월 6일 접속된 미국 환경보호청 프로그램 평가 용어집
  23. ^ 2008년 1월 6일 접속된 세계은행 독립평가단
  24. ^ OECD-DAC(2002) 평가 및 결과 기반 관리의 주요 용어 해설 제안, OECD, 파리
  25. ^ 유니세프 (2004) 유니세프 평가 보고서 표준, 평가 사무소, 뉴욕 유니세프 NYHQ
  26. ^ "Evaluation Definition: What is Evaluation? - EvaluationWiki". Retrieved 16 January 2017.
  27. ^ Jump up to: a b "Page Not Found". Retrieved 16 January 2017. Cite는 일반 제목(도움말)을 사용한다.
  28. ^ "Banerjee, A. V. (2007) 'Making Aid Work' Cambridge, Boston Review Book, MIT Press, MA" (PDF). Retrieved 16 January 2017.[영구적 데드링크]
  29. ^ Bamberger, M. and White, H.(2007) 개발도상국에서 강력한 평가 설계 사용: 경험과 과제, 다학제 평가 저널, 제4권, 제8권, 58-73권
  30. ^ http://www.europeanevaluation.org/download/?noGzip=1&id=1969403[permanent dead link] EES Statement: 방법론적으로 다양한 영향 평가 접근방식의 중요성
  31. ^ http://www.odi.org.uk/resources/odi-publications/opinions/127-impact-evaluation.pdf '골드 스탠더드'는 평가를 위한 은총탄이 아니다.
  32. ^ "Aid effectiveness: The role of qualitative research in impact evaluation".
  33. ^ Prowse, Martin; Camfield, Laura (2013). "Improving the quality of development assistance". Progress in Development Studies. 13: 51–61. doi:10.1177/146499341201300104. S2CID 44482662.
  34. ^ Jump up to: a b "White, H. (2009b) Theory-based impact evaluation: Principles and practice, Working Paper 3, International Initiative for Impact Evaluation, New Delhi". Archived from the original on 2012-11-06. Retrieved 2012-10-29.
  35. ^ Gertler, P. (2000) 최종 보고서: 프로그레사가 건강에 미치는 영향. 워싱턴 D.C. 국제 식품 정책 연구소
  36. ^ "Untitled Document" (PDF). Retrieved 16 January 2017.
  37. ^ Fiszbein, A. and Schady, N. (2009) 조건부 현금 이체: 현재와 미래의 빈곤 감소: 세계은행, World Bank, Washington, D.C.의 세계은행 정책 연구 보고서.
  38. ^ 영향 평가: 세계은행 독립평가단의 경험, 2006년
  39. ^ "When Will We Ever Learn? Improving Lives Through Impact Evaluation". Retrieved 16 January 2017.

소스 및 외부 링크