재는 방법을 몰라서라기보다, 시간·인력 같은 자원과 관리자의 지원, 평가 방법 전문성이 교육 담당자 한 사람의 손에 없기 때문입니다. Kennedy 등(2014)의 조사에서 3단계(행동)를 교육의 60% 이상에서 재는 교육 전문가는 26.08%, 4단계(결과)는 13.15%였습니다. 모델의 인과 가정도 1989년 Alliger & Janak이 이미 문제 삼았습니다. 현실적인 대안은 설계 단계에서 목표 성과와 지표를 현업과 먼저 합의하고, 3단계를 복귀 직후부터 가볍게 재고, 성공 사례 기법과 기수 간 비교로 증거를 모으며 한계를 함께 보고하는 것입니다.
목차
교육 담당자에게 커크패트릭 4단계 모델을 아느냐고 물으면 대부분 압니다. 반응(Reaction) · 학습(Learning) · 행동(Behavior) · 결과(Results). 도널드 커크패트릭이 1959~1960년 네 편의 글로 내놓은 뒤 60년 넘게 HRD의 기본 문법이었습니다.
그럼 3·4단계를 실제로 재고 있느냐고 물으면, 대화가 조용해집니다.
이 글은 그 침묵을 다룹니다. 왜 모두가 아는 모델의 절반이 현장에서 작동하지 않는지, 그리고 그 자리에 무엇을 놓을 수 있는지에 대한 것입니다. 먼저 답부터 적습니다. 재는 방법을 몰라서라기보다 시간·인력, 관리자의 지원, 평가 전문성이 교육 담당자 한 사람의 손에 없기 때문이고, 대안은 완벽한 인과 증명 대신 설계 단계에서 무엇을 볼지 합의하고 가벼운 측정을 일찍 시작하는 것입니다.

🪜 4단계는 원래 무엇을 재나
4단계는 ‘조직에 생긴 모든 변화’가 아니라, 교육과 현업 지원의 결과로 미리 정한 목표 성과가 났는지를 봅니다.
모델을 관리하는 Kirkpatrick Partners가 지금 쓰는 공식 정의로 표를 다시 적으면 이렇습니다.
| 단계 | 재는 것 | 전형적 도구 | 언제 재나 |
|---|---|---|---|
| 1. 반응 | 대상자가 교육을 유익하고, 몰입할 만하고, 자기 일에 관련 있다고 느끼는가 | 과정 중 수시 확인, 종료 설문 | 교육 중 · 직후 |
| 2. 학습 | 목표한 지식·스킬·태도와 함께 자신감과 실천 의지를 얻었는가 | 사전·사후 평가, 롤플레이, 실습 | 교육 중 · 직후 |
| 3. 행동 | 현업에서 핵심 행동을 하고 있고, 그 행동이 지원받고 책임지워지는가 | 관찰, 상사 확인, 업무 기록 | 현업 복귀 직후부터 이어서 |
| 4. 결과 | 교육과 현업 지원의 결과로 목표한 조직 성과가 나타났는가 | 미리 정한 선행·후행 지표 | 선행 지표는 일찍, 후행 지표는 그 지표의 주기대로 |

두 가지를 짚어 둡니다.
첫째, 4단계는 매출 전체가 아닙니다. 공식 정의는 “목표한 조직 성과가 교육과 성과 지원의 결과로 나타난 정도”입니다. 무엇이 목표인지는 교육 전에 정해 두어야 하고, 그래서 Kirkpatrick Partners는 설계를 4단계에서 시작해 1단계로 거꾸로 내려오라고 권합니다. 지표는 앞서 움직이는 선행 지표와 나중에 확인되는 후행 지표를 함께 고르고, 그 대부분은 조직 어딘가에 이미 쌓이고 있으니 찾아서 접근을 요청하라고 적습니다.
둘째, 3단계는 기다렸다가 재는 단계가 아닙니다. 같은 곳은 행동 측정을 “학습 후 90일이 지나서 시작할 수는 없다”고 씁니다. 너무 늦게 재면 방향을 고칠 기회를 잃기 때문입니다. 흔히 “3단계는 36개월 뒤, 4단계는 612개월 뒤”라고 외우지만, 공식 설명은 그런 고정 시점을 두지 않습니다. 첫 측정은 복귀 직후에 시작하고, 행동이 자리 잡았는지는 이어서 봅니다.
그래도 1·2단계와 3·4단계의 난이도 차이는 그대로입니다. 1·2단계는 교육이 끝나는 자리에서, 교육 담당자의 권한 안에서 끝납니다. 3·4단계는 다른 부서의 데이터와 현업의 지원이 필요하고, 통제할 수 없는 변수가 끼어듭니다.
📉 얼마나 안 하고 있나
3단계를 교육의 60% 이상에서 재는 교육 전문가는 26.08%, 4단계는 13.15%였습니다(Kennedy 등, 2014).
여기서 자주 인용되는 숫자들이 있는데, 출처가 블로그인 경우가 많습니다. 그래서 동료 심사를 거친 연구 하나를 기준으로 삼겠습니다.
케네디·정(Chyung)·위니에츠키·브링커호프가 2014년 『International Journal of Training and Development』 18권 1호에 실은 「Training professionals’ usage and understanding of Kirkpatrick’s Level 3 and Level 4 evaluations」입니다. 케네디가 2012년 보이시주립대에 낸 석사 논문이 바탕이고, 교육 전문가 68명에게 설문하고 22명을 인터뷰했습니다.
3단계와 4단계를 실제로 수행하는 비율
“가끔이라도 한다”와 “교육의 60% 이상에서 한다”는 전혀 다른 이야기입니다 · 출처: Kennedy et al. (2014)
- 가끔이라도 수행
- 교육의 60% 이상에서 수행
표로 보면 이렇습니다.
| 가끔이라도 수행 | 교육의 60% 이상에서 수행 | |
|---|---|---|
| 3단계 (행동) | 43.47% | 26.08% |
| 4단계 (결과) | 18.41% | 13.15% |
“가끔이라도 한다”와 “일상적으로 한다”를 나눈 것이 이 연구의 미덕입니다. 설문에서 “3단계 하십니까?”에 “예”라고 답하기는 쉽습니다. 한 번이라도 했으면 예니까요. 일상적 실무로 자리 잡았는지를 물으면 3단계는 넷 중 하나, 4단계는 여덟 중 하나로 떨어집니다.
다만 이 숫자의 크기를 업계 평균처럼 읽으면 안 됩니다. 설문 응답자가 68명인 작은 조사이고, 소수점 둘째 자리까지 적혀 있어도 응답자 한 사람이 1.5%p 안팎에 해당하는 규모입니다. 이 연구에서 가져갈 것은 정밀한 비율보다 ‘가끔’과 ‘일상’ 사이의 큰 낙차입니다.
🚧 무엇이 막고 있나
연구가 꼽은 걸림돌은 셋입니다. 시간·인력 같은 자원, 관리자의 지원, 평가 방법에 대한 전문성.
같은 연구가 3·4단계를 하게 하거나 막는 요인을 물었습니다. 초록이 정리한 세 요인은 이렇습니다.
3·4단계 평가를 좌우하는 세 요인
연구 참가자가 꼽은 핵심 요인 · 초록은 순위나 비율 없이 세 가지를 나란히 제시합니다 · 출처: Kennedy et al. (2014)
이 연구를 인용하며 세 요인에 ‘57%·55%·50%’ 같은 비율을 붙이거나 ‘데이터 접근’을 세 번째로 꼽는 글이 있는데, 논문 초록과 학위논문 요약에서는 그런 비율도, 그런 항목 이름도 찾지 못했습니다. 초록이 적은 것은 위의 세 가지입니다.
세 요인 중 둘은 교육 담당자 혼자서는 해결할 수 없는 것입니다. 시간과 인력은 예산 결정권자의 몫이고, 관리자의 지원은 현업 부서의 협조 문제입니다. 남은 하나인 평가 전문성은 개인의 역량이지만, 이것도 조직이 훈련 기회를 줘야 자랍니다.
여기서 흔한 오진이 나옵니다. “교육팀이 게을러서 안 한다” 는 진단입니다. 연구가 가리키는 것은 의지가 아니라 자원·지원·역량의 구조적 부족입니다. 처방이 달라져야 합니다. 독려가 아니라 시간 배정, 현업 리더의 약속, 방법론 훈련이 필요합니다.
인터뷰에서는 하나가 더 나왔습니다. 결과 평가가 무엇을 잴 수 있고 조직에 왜 중요한지를 교육 전문가 스스로 설명할 수 있어야 한다는 것입니다. 그 설명을 못 하면 자원과 지원도 오지 않습니다. 걸림돌이 서로 물려 있는 셈입니다.
🔍 4단계는 정말 가장 어려운가
계산이 어려운 것이 아니라, 무엇을 볼지 미리 정하지 않아서 어려워집니다.
Kirkpatrick Partners는 “4단계가 가장 재기 어렵다는 생각은 흔한 오해”라고 씁니다. 필요한 지표는 대개 이미 어딘가에서 쌓이고 있으니, 그 자리를 찾아 접근을 요청하면 된다는 것입니다. 위의 연구 결과와 부딪히는 말처럼 들리지만, 둘은 같은 이야기를 다른 쪽에서 합니다.
어려움의 정체는 나중에 인과를 증명하려는 시도입니다. 교육이 끝난 뒤 매출이 올랐다면, 그중 얼마가 교육 덕인지 가려내려면 통제집단과 긴 추적이 필요합니다. Kirkpatrick Partners도 지금은 교육만의 효과를 떼어 내는 ROI 대신 세 가지를 권합니다. 이해관계자가 사전에 정의한 성공 기준(ROE, Return on Expectations), 행동과 성과의 변화를 증거로 보여 주는 성과 수익(ROP, Return on Performance), 그리고 교육이 전체 개선에 기여한 몫을 합리적으로 보여 주는 기여 ROI(contributive ROI)입니다.
정리하면 이렇습니다. 사전 합의가 있으면 4단계는 이미 쌓이는 지표를 읽는 일이 됩니다. 사전 합의가 없으면 끝난 뒤에 증거를 새로 만들어야 하는 일이 되고, 그건 실제로 어렵습니다. 연구에서 4단계 수행률이 낮게 나온 것도 이 차이로 설명됩니다.
🧪 모델 자체에도 금이 있나
있습니다. 단계들이 인과로 이어진다는 가정은 1989년에 이미 도전받았고, 만족도는 행동 변화의 약한 신호입니다.
앨리거와 자낙이 『Personnel Psychology』 42권 2호에 실은 「Kirkpatrick’s Levels of Training Criteria: Thirty Years Later」(1989)는 커크패트릭 모델에 세 가지 문제적 가정이 깔려 있다고 정리하고, 각각을 문헌으로 검토했습니다.
| 가정 | 내용 | 왜 문제인가 |
|---|---|---|
| 위계 | 단계가 올라갈수록 더 많은 정보를 준다 | 4단계 지표가 항상 더 유용한 것은 아니다 |
| 인과 | 1→2→3→4로 인과가 이어진다 | 만족했다고 배우는 것도, 배웠다고 행동이 바뀌는 것도 아니다 |
| 상관 | 단계들은 서로 양의 상관을 갖는다 | 기존 연구의 상관을 모아 보니 가정을 받칠 만큼 일관되지 않았다 |
두 번째 가정이 실무에 가장 큰 영향을 줍니다. “만족도가 높으니 효과가 있었을 것” 이라는 추론은 이 가정 위에 서 있는데, 그 가정이 약합니다. 만족도는 강사의 화술과 간식의 질에도 반응합니다.
8년 뒤 앨리거 등(1997)은 34개 연구에서 나온 상관 115개를 메타분석했습니다. 결과가 실무에 바로 쓸 만합니다. 반응을 정서적 반응(좋았다)과 효용 반응(쓸모 있다)으로 나누자, 효용 반응이 학습과 현업 적용 모두와 더 강하게 이어졌습니다. 효용 반응은 교육 직후의 시험 점수보다도 현업 적용과 더 강하게 관련됐습니다.
그래서 종료 설문의 첫 문항을 바꾸는 것만으로도 1단계의 쓸모가 달라집니다. “만족하셨습니까”가 아니라 “오늘 배운 것 중 다음 주 업무에 쓸 것이 있습니까, 무엇입니까” 로 묻습니다. Kirkpatrick Partners가 지금 1단계 정의에서 ‘관련성’을 가장 중요한 측정으로 꼽는 것과도 같은 방향입니다.
역설적이지만 이것은 좋은 소식이기도 합니다. 1·2단계를 아무리 잘 재도 3·4단계를 대신할 수 없다면, 3·4단계를 재지 않을 핑계도 사라집니다.
🛠️ 그럼 무엇을 할 것인가
완벽한 인과 증명 대신, 덜 엄밀하지만 결정에 쓸 수 있는 방법 네 가지를 씁니다.
완전한 4단계 평가는 통제집단, 장기 추적, 교란 변수 통제를 요구합니다. 대부분의 조직에서 현실적이지 않습니다. 대신 쓸 수 있는 방법들이 있습니다.
① 성공 사례 기법 (Success Case Method)
로버트 브링커호프가 2003년 책으로 정리한 방법입니다. 위 2014년 연구의 공저자이기도 하고, 그 연구 자체가 이 방법을 틀로 썼습니다. 발상이 간단합니다.
교육 참가자 전원을 평균 내지 않고, 가장 성과가 좋았던 소수와 전혀 변화가 없었던 소수를 골라 깊게 인터뷰합니다. 그리고 묻습니다.
성공한 사람들은 무엇이 달랐는가 — 교육 자체인가, 상사의 지원인가, 적용할 기회가 있었는가?
평균값은 “효과 있었음/없었음”만 알려 주지만, 이 방법은 효과가 나는 조건을 알려 줍니다. 다음 설계를 바꿀 수 있는 것은 후자입니다. 성공 사례가 상사의 지원에서 갈렸다면, 다음 기수에는 교육 내용보다 상사 안내문을 먼저 손봐야 합니다.
② 통제집단 없이도 할 수 있는 비교
무작위 배정은 어렵지만, 대체할 수 있는 비교는 있습니다.
- 시차 비교(기수 간 비교) — 같은 대상을 1차·2차 기수로 나눠 시차를 두고 운영합니다. 1차 기수가 교육을 마친 뒤, 아직 교육을 받지 않은 2차 기수와 같은 시점에 비교합니다. 두 집단이 같은 기간의 시장·조직 변화를 똑같이 겪으므로, 차이를 교육 쪽으로 읽을 근거가 생깁니다. 2차 기수가 교육을 받은 뒤 같은 차이가 다시 나타나면 근거가 더 단단해집니다.
- 미이수자 비교 — 같은 기간 교육을 안 받은 유사 직무군과 비교합니다. 스스로 신청한 사람이 원래 더 의욕적일 수 있으니(선택 편의) 그 점을 감안해 해석합니다.
- 자기 전후 비교 + 추세선 — 같은 집단의 교육 전후를 비교하되, 교육 이전 12개월 추세를 그려 놓고 교육 뒤 추세가 꺾였는지 봅니다. 추세 없이 전후만 비교하면 원래 오르던 지표를 교육 효과로 착각하기 쉽습니다.
시차 비교에서 주의할 점이 하나 있습니다. 누가 1차 기수가 되는지를 부서장 추천이나 성과 순으로 정하면 두 집단이 처음부터 다릅니다. 입사 시기·지역처럼 성과와 무관한 기준으로 나누고, 그 기준을 기록해 둡니다.
셋 다 완벽하지 않습니다. 중요한 것은 한계를 함께 보고하는 것입니다. “교육 때문입니다”가 아니라 “교육 후 이 지표가 이렇게 움직였고, 이 요인들은 통제하지 못했습니다”라고 씁니다. 앞서 본 기여 ROI도 같은 태도입니다. 과장하지 않는 보고가 다음에도 예산을 받습니다.
③ 3단계를 가볍게, 일찍 재기
3단계를 어렵게 만드는 것은 대개 “관찰”이라는 단어입니다. 현업에 나가 지켜보는 것은 비쌉니다. 대신 이렇게 할 수 있습니다. 시점은 Kirkpatrick Partners가 경고한 90일 안쪽에 둡니다.
- 복귀 2주 안에 상사 1문항 — “이 사람이 배운 것을 써 볼 기회가 있었습니까? 없었다면 무엇이 막았습니까?”
- 교육 8주 후 3문항 설문 — “배운 것 중 실제로 써 본 것은?”, “못 쓴 이유는?”, “쓰는 데 무엇이 필요한가?”
- 업무 산출물 표본 검토 — 교육 전후 작성된 문서·코드·제안서를 표본으로 비교
8주 설문은 끝이 아니라 중간 점검입니다. 행동이 습관이 됐는지는 그 뒤에도 지표의 주기(월간 품질 지표, 분기 고객 평가 등)에 맞춰 이어서 봅니다.
응답률이 낮아도 괜찮습니다. 0건보다는 훨씬 낫고, 못 쓴 이유를 모으면 그 자체가 다음 설계의 입력값이 됩니다. “써 볼 기회가 없었다”는 답이 많다면 문제는 교육이 아니라 현업 환경에 있습니다. 공식 정의가 3단계에 ‘지원과 책임’을 넣은 이유가 이것입니다.
④ 무엇을 볼지 미리 합의하기
가장 자주 빠지는 단계입니다. 교육이 끝난 뒤에 “무슨 지표로 성과를 증명하지?”를 고민하면 이미 늦습니다. 데이터가 그 형태로 쌓이지 않았기 때문입니다.
교육 설계 단계에서 현업 리더와 합의해야 하는 것은 셋입니다.
- 이 교육이 성공하면 무엇이 달라져 있어야 하는가 (행동 수준)
- 그 변화를 어떤 데이터로 볼 것인가 (이미 쌓이고 있는 것 중에서, 선행 지표 하나 이상 포함)
- 언제 볼 것인가 (첫 측정은 복귀 직후)
이 합의가 있으면 3·4단계는 “나중에 하는 어려운 일”이 아니라 “처음부터 예약된 일” 이 됩니다. 앞서 본 걸림돌 중 ‘관리자의 지원’도 이 자리에서 함께 받아 냅니다. 지표를 같이 고른 리더는 데이터를 내주는 데 덜 망설입니다.
📋 측정 설계 점검표
다음 교육을 설계할 때 아래 여덟 항목을 확인하면, 비어 있는 칸이 곧 손볼 곳입니다.
| 확인 항목 | 있으면 ✓ |
|---|---|
| 교육 전에 “성공하면 무엇이 달라지는가”를 문장으로 적었는가 | |
| 그 변화를 볼 데이터가 이미 쌓이고 있는가 (새로 만들지 않아도 되는가) | |
| 현업 리더가 그 지표와 데이터 제공에 동의했는가 | |
| 기저선(교육 이전 값)을 확보했는가 | |
| 비교 대상(기수 간·미이수자·추세선 중 하나)이 있는가 | |
| 첫 측정 날짜가 복귀 후 90일 안에 잡혀 있는가 | |
| 성공·실패 사례를 각각 인터뷰할 계획이 있는가 | |
| 보고서에 “통제하지 못한 요인” 항목이 있는가 |
여덟 칸을 한 번에 다 채울 필요는 없습니다. 첫 교육에서 두세 칸을 채우고, 다음 교육에서 한 칸씩 늘리면 됩니다.
📌 정리
- 커크패트릭 모델은 널리 알려져 있지만, 3단계를 일상적으로 재는 교육 전문가는 넷 중 하나, 4단계는 여덟 중 하나였습니다(Kennedy 등, 2014 · 응답자 68명의 작은 조사).
- 막는 것은 의지가 아니라 자원(시간·인력) · 관리자의 지원 · 평가 전문성 입니다. 셋 중 둘은 교육 담당자 권한 밖입니다.
- 공식 정의에서 4단계는 조직의 모든 변화가 아니라 미리 정한 목표 성과입니다. 설계는 4단계에서 시작해 거꾸로 내려옵니다.
- 3단계 측정은 90일을 기다리지 않습니다. 복귀 직후 시작해 8주 점검, 이후 지표 주기대로 이어 갑니다.
- 모델의 인과 가정은 1989년에 이미 도전받았습니다. 만족도 대신 “쓸모 있었나”를 물으면 현업 적용과 더 가까운 신호를 얻습니다(Alliger 등, 1997).
- 완벽한 인과 증명 대신 성공 사례 기법 · 기수 간 비교 · 가벼운 3단계 측정 · 솔직한 한계 서술로 옮깁니다.
- 가장 큰 차이는 방법론이 아니라 시점입니다. 측정은 교육이 끝난 뒤가 아니라 설계할 때 정해집니다.
“증명할 수 없는 교육”과 “증명하지 않은 교육”은 다릅니다. 대부분의 교육은 후자입니다.
❓ 자주 묻는 질문
커크패트릭 3·4단계를 실제로 재는 조직은 얼마나 되나요?
Kennedy, Chyung, Winiecki & Brinkerhoff(2014)의 조사에서 3단계(행동)를 교육의 60% 이상에서 수행한다는 교육 전문가는 26.08%, 4단계(결과)는 13.15%였습니다. 가끔이라도 한다는 응답까지 넓히면 각각 43.47%, 18.41%입니다. 설문 응답자 68명의 작은 조사라 정밀한 업계 평균보다 ‘가끔’과 ‘일상’의 큰 차이로 읽는 것이 맞습니다.
3·4단계 측정을 막는 가장 큰 이유는 무엇인가요?
같은 연구의 초록은 세 요인을 꼽습니다. 시간·인력 같은 자원, 조직 차원의 관리자 지원, 개인 차원의 평가 방법 전문성입니다. 초록에는 요인별 비율이 없습니다. 셋 중 둘은 교육 담당자 개인의 의지로 해결되지 않는 조직의 문제입니다.
4단계 ‘결과’는 매출을 재야 하나요?
꼭 그렇지 않습니다. Kirkpatrick Partners의 공식 정의에서 4단계는 교육과 현업 지원의 결과로 목표한 조직 성과가 나타난 정도입니다. 무엇을 볼지는 설계 단계에서 현업 리더와 정하고, 선행 지표와 후행 지표를 함께 고릅니다. 그 지표는 대개 조직 어딘가에 이미 쌓이고 있습니다.
3단계는 교육 후 언제 재야 하나요?
현업에 복귀한 직후부터 시작합니다. Kirkpatrick Partners는 행동 측정을 학습 후 90일이 지나서 시작할 수는 없다고 씁니다. 늦게 재면 방향을 고칠 기회를 잃기 때문입니다. 예컨대 복귀 2주 안에 상사 1문항, 8주 뒤 3문항 설문으로 점검하고, 이후에는 관련 지표의 주기에 맞춰 이어서 봅니다.
통제집단을 만들 수 없는데 성과 측정이 가능한가요?
가능합니다. 완벽한 인과 추론 대신 시차 비교(같은 대상을 1·2차 기수로 나눠 운영하고, 1차 기수가 교육을 마친 뒤 아직 받지 않은 2차 기수와 같은 시점에 비교), 미이수자 비교, 자기 전후 비교에 추세선을 더한 방법 중 하나를 쓰고, 통제하지 못한 요인을 보고서에 명시하면 됩니다. 성공 사례 기법(Success Case Method)처럼 가장 잘된 사람과 변화가 없던 사람을 인터뷰해 효과가 나는 조건을 찾는 방법도 있습니다.
출처
- Kennedy, Chyung, Winiecki & Brinkerhoff — Training professionals’ usage and understanding of Kirkpatrick’s Level 3 and Level 4 evaluations, International Journal of Training and Development 18(1), 1–21 (Wiley) (2014)
- Perri Estes Kennedy — Training Professionals’ Usage and Understanding of Kirkpatrick’s Level 3 and Level 4 Evaluations, 석사 논문 (Boise State University ScholarWorks, 설문 68명·인터뷰 22명) (2012)
- Alliger & Janak — Kirkpatrick’s Levels of Training Criteria: Thirty Years Later, Personnel Psychology 42(2), 331–342 (Wiley) (1989)
- Alliger, Tannenbaum, Bennett, Traver & Shotland — A Meta-Analysis of the Relations Among Training Criteria, Personnel Psychology 50(2), 341–358 (Wiley) (1997)
- Kirkpatrick Partners — The Kirkpatrick Model (공식 단계 정의 · ROE/ROP/cROI) (2026)
- Robert O. Brinkerhoff — The Success Case Method: Find Out Quickly What’s Working and What’s Not (Berrett-Koehler) (2003)
우리 조직에 적용하면? 🚀
조직 상황에 맞는 플랫폼 조합과 도입 방식을 2영업일 내 제안드립니다.



