던닝-크루거 곡선은 무능의 초상이 아니라 척도의 자화상이다
실력이 한 톨도 들어 있지 않은 숫자를 천 쌍 만들었다. 한쪽은 시험 점수라 치고, 다른 한쪽은 「내 실력은 몇 번째쯤일 것 같다」는 자기평가라 쳤다. 둘 사이에는 아무 관계도 없다 — 난수 발생기가 뽑은 값이다. 이 가짜 성적표를 실제 점수 순으로 넷으로 가르고 각 뭉치의 실제 평균과 자기평가 평균을 나란히 찍었더니, 두 선이 X자로 벌어졌다. 아래쪽 뭉치의 자기평가는 실제보다 한참 위에, 위쪽 뭉치는 한참 아래에 있다.
같은 모양의 그림이 하나 더 있다. 1999년 심리학 논문의 것이다. 유머·논리·문법 시험을 치른 대학생들에게 「같은 시험을 본 사람들 사이에서 몇 번째쯤일 것 같으냐」를 물었더니, 성적 하위 4분의 1은 실제로 100명 중 아래에서 열두 번째 언저리인데 자기를 한가운데보다 훨씬 위에 놓았다. 그 그림에 붙은 이름이 던닝-크루거 효과다 — 무능한 사람일수록 자기를 과대평가한다는 명제이고, 신문 표제로 옮겨 가서는 「무식하면 용감하다」가 되었으며 인터넷에서는 남을 가리키는 밈이 되었다.
두 그림은 전혀 다른 데서 나왔다. 하나는 난수 발생기, 하나는 코넬대 강의실이다. 그런데 모양이 같다. 그렇다면 이 곡선은 사람에 관한 그림인가, 사람을 재는 척도에 관한 그림인가. 우리 답은 후자다. 던닝-크루거 곡선은 무능한 사람의 초상이 아니라 자기평가라는 척도의 자화상이다. 다만 척도가 만든 모양을 걷어내도 어긋남은 남고, 남은 것의 정체는 27년째 결론이 나지 않았다. 우리 계산도 그것을 판별하지 못한다. 그 사실을 감추지 않은 위에서 우리는 한쪽에 선다.
1999년의 그 논문이 실제로 잰 것
설계는 단순하다. 채점 결과를 알려 주기 전에 물었다. 당신의 실력은 몇 번째쯤일 것 같습니까. 가장 널리 인용되는 숫자는 초록에 있다. 실제 성적은 아래에서 열두 번째, 자기평가는 62번째. 이 쌍은 네 연구를 아울러 요약한 값이지 어느 한 연구의 결과가 아니다. 연구별로는 유머 시험이 58번째, 논리 시험의 시험점수 자기평가가 62번째다.
덜 인용되는 절반이 있다. 원 논문은 상위 4분의 1의 과소평가도 함께 보고했다 — 논리 시험에서 실제 86번째가 자기를 68번째로, 문법 시험에서 실제 89번째가 자기를 72번째로 놓았다. 성적 순으로 넷으로 가른 각 구간을 사분위라 하는데, 원 논문의 그림은 그 사분위별 평균 두 줄의 비교다. 두 선이 X자로 만난다. 「무능한 사람이 과신한다」는 그 그림의 절반이다.
「무지의 봉우리」·「절망의 골짜기」가 붙은 그 자신감 곡선은 원 논문에 없다. 인터넷 시대에 만들어진 그래픽이고 두 저자가 보고한 적이 없다.
원 논문 = Kruger, J. & Dunning, D. (1999) "Unskilled and Unaware of It," Journal of Personality and Social Psychology 77(6) 1121–1134. 네 연구의 표본은 각각 45~140명, 합 334명이고 전부 한 대학의 수강생인 편의표본이다. 네 번째 연구에만 붙은 훈련 개입은 그 결과 수치를 읽지 못했다.
곡선은 데이터가 아니라 그리는 순서에서 나온다
어떤 결과가 정말 무언가를 보여 주는지 확인하는 싼 방법이 있다. 아무 일도 일어나지 않은 데이터로 같은 절차를 그대로 돌려 보는 것이다 — 아무것도 안 들어 있는데 같은 그림이 나오면 그 그림은 증거가 아니다. 통계에서는 이 대조군을 귀무 모형이라 부른다.
우리는 그것을 직접 만들었다. 서로 무관한 난수 천 쌍을 실제 점수 순으로 넷으로 가르고, 각 뭉치의 평균을 백분위(100명을 줄 세웠을 때 아래에서 몇 번째인가)로 찍었다. 아래쪽 뭉치의 자기평가 평균은 실제보다 35 포인트 위, 위쪽 뭉치는 36 포인트 아래다. 시드를 서른 번 바꿔도 방향은 같다.
자기평가와 실제 능력의 참상관이 0인 난수 1,000쌍 · 시드 42 · 값은 (자기평가 백분위 평균 − 실제 백분위 평균). 시드 30회 반복 평균은 하위 +38.29(표준편차 1.95)·상위 −37.90(1.70). 중간 두 칸(12.06 · −11.52)은 f40 셀에 실린 사분위 평균의 차분이다(49.55−37.49 · 50.99−62.51). 원 논문(코넬 학부 소표본)·Gignac(폴란드 성인)의 실측 격차와 «같은 그림에 병치하지 않는다» —
research.md 원자료 경계가 네 계열의 절대수치 병치를 금한다. 이 그림이 주장하는 것은 「아무 효과가 없는 데이터에서도 이 부호 패턴이 나온다」 하나다.곡선이 나타나는 순서는 이렇다. 자기 실력을 백분위로 답하게 하고 → 실제 점수로 응답자를 넷으로 가르고 → 각 뭉치에서 두 평균을 함께 찍으면 → X자가 나오고 → 그 모양을 사람의 성향으로 읽는다. 어긋남은 두 번째와 세 번째 사이에서 이미 결정된다.
본문 §3이 세운 사슬의 압축 — 새 인과를 도입하지 않는다. 화살표는 순서와 의존이지 크기가 아니다.
사분위는 실제 점수로 선별한 구간이라 그 구간의 실제 평균이 정의상 양 끝에 놓이고, 난수로 만든 자기평가는 그 선별과 무관하니 평균이 어느 뭉치에서나 한가운데에 머문다. 선별 효과, 통계학에서 평균 회귀라 부르는 것이 이것이고, 인지 편향의 증거는 한 톨도 들어 있지 않다.
자기평가가 실력을 더 잘 반영할수록 곡선이 완만해진다. 두 값이 얼마나 함께 움직이는지를 −1에서 1 사이로 잰 것을 상관이라 하는데(여기서는 양의 구간만 쓴다), 이 값을 0.2에서 0.6까지 올리면 격차가 단조롭게 줄어든다. 반대로 자기평가에 정보가 하나도 없으면 격차는 최대에 도달하고 그 이상 커지지 않는다. 교차는 사람들이 틀려서 생기지 않는다. 자기평가가 실력을 반영하지 않아서 생긴다.
이 곡선은 사람에 관한 그림이기 전에 그리는 방식에 관한 그림이다. 메르카토르 도법에서 그린란드가 아프리카만 하게 보이는 것도 그린란드가 아니라 투영법의 성질이다. 다만 우리 난수에는 실제 응답의 제약이 하나 빠져 있다 — 백분위 눈금 자체에 상한이 있다. 그렇다면 모양을 걷어낸 뒤 무엇이 남고, 남은 것이 사람의 성질인지 눈금의 성질인지 우리는 가를 수 있는가.
순환 논증이 아니냐는 반문이 가능하다. 귀무 모형은 실재에 관한 주장이 아니라 대조군이고, 아무것도 없을 때 무엇이 보이는지 보려면 데이터는 정의상 우리가 만든 것이어야 한다. 2016년 재검정은 난수로, 2020년 재검정은 실제 사람 데이터로 같은 재현을 보였다. 코드·시드·조건은 공개한다.
모양을 걷어내도 어긋남은 남는다
인공물이라는 비판, 곧 재는 방법이 허상을 만들었다는 비판을 「효과가 없다」로 읽으면 안 된다. 2020년 재검정의 저자들은 효과가 이전 보고보다 훨씬 작을 수 있다고 쓰면서 던닝-크루거 효과가 전부가 아니라 대부분 통계적 인공물이라고 한정했다. 귀무 모형의 재현은 패턴이 증거가 못 된다는 말이지 재는 대상이 없다는 말이 아니다.
그리고 실제로 남는 것이 있다. 원 논문의 X자는 좌우가 대칭이 아니다. 아래쪽 어긋남이 위쪽보다 뚜렷하게 크다. 그런데 우리 난수에서 위로 미는 성분을 빼고 상관값만 바꾸면 어떤 값에서도 두 격차가 거의 같은 크기로 마주 본다.
| 자기평가–실제 상관 | 아래쪽 뭉치 격차 | 위쪽 뭉치 격차 |
|---|---|---|
| 0.0 (전혀 무관) | +35.41 | −35.95 |
| 0.2 | +28.23 | −28.62 |
| 0.4 | +21.23 | −21.51 |
후보 ③ — 척도의 상한이 만드는 겉보기 비대칭이다.
우리 난수 시뮬레이션 — 사람 데이터가 아니다. 상향 성분 없음 · N=1,000 · 시드 42 · 격차 = 자기평가 백분위 평균 − 실제 백분위 평균 · f40·f42·f54.
원 논문의 비대칭은 우리 모형에서는 재현되지 않았다. 다만 이것은 실재의 제약이 아니라 모형의 성질일 수 있다 — 우리 난수 자기평가는 균등한 백분위라 방금 말한 상한이 없고 측정오차 구조도 없다. 대칭 기저만으로는 그 비대칭이 서지 않는다.
그 남은 성분이 무엇인가. 이것이 27년 논쟁의 실제 내용이고, 널리 다투는 후보는 셋이다.
후보 ① — 거의 모두가 자기를 위로 놓는 치우침(심리학의 평균 이상 효과)이 선별 효과가 만든 대칭 기저 위에 얹혀 있다는 쪽이다. 같은 치우침이 아래쪽에서는 격차를 부풀리고 위쪽에서는 깎으니 한쪽만 큰 비대칭으로 보인다. 우리가 지어낸 설명이 아니다 — Krueger & Mueller가 2002년에 평균 이상 효과와 통계적 회귀로 이 패턴이 대부분 설명된다고 썼고, 원저자들의 반박이 같은 저널 같은 호 바로 뒤에 실렸다.
후보 ② — 아래쪽 사람들이 특별히 더 위로 치우친다는 쪽이고, 던닝-크루거 효과가 원래 주장한 그것이다.
후보 ③ — 척도의 상한이 만드는 겉보기 비대칭이다. 답을 0에서 100 사이로만 적을 수 있으면 상위권은 아래로만, 하위권은 위로만 크게 틀릴 여지가 있다. 인지 편향을 하나도 넣지 않아도 치우침이 능력에 따라 달라지는 것처럼 보인다. 이 후보에도 전용 논문이 있다 — Magnus & Peresetsky가 2022년에 이것 하나를 주제로 썼고, 같은 방향의 논거가 2016년 재검정의 천장 효과 서술에도 이미 있었다. ③이 맞다면 그것은 심리가 아니라 눈금의 성질이다.
세 후보를 견주려면 축을 갈라야 한다. 정확도(=앞서 본 상관 · 심리측정에서는 변별력)는 순위를 얼마나 잘 맞히는가이고, 치우침은 값이 계통적으로 위나 아래로 쏠려 있는가다. 늘 2킬로그램을 더 가리키는 체중계는 누가 더 무거운지는 맞히면서 몇 킬로그램인지는 전원에게 틀리게 알려 준다. ①과 ③은 눈금 쪽 설명이고 ②만 사람 쪽 설명이다.
이 물음을 가장 가까이 겨눈 대리 검정은 2020년 재검정에 있다. 폴란드 성인 929명에게 자기 IQ를 추정하게 해 객관 검사와 대조하고, 「능력이 낮을수록 자기평가 오차가 커지는가」를 이질성 검정(오차 크기가 능력에 따라 달라지는지 보는 검정)으로 돌렸다. 방향은 던닝-크루거의 예측대로 음수였으나 유의하지 않았고, 신뢰구간은 효과가 있어도 상관 절댓값 0.11을 넘지 않는다는 것까지만 말한다. 2차항 검정도 유의하지 않았다. 「없다」가 아니라 「있어도 작다」다.
반대쪽에는 2021년 연구가 있다. 잡음을 넣은 합리적 행위자 모형만으로 곡선이 재현된다는 것까지 인정한 다음, 실제 데이터는 성분을 하나 더 얹은 모형에 더 잘 맞았다고 보고했다. 두 실험에서 각각 약 4,000명이 실제 과제를 수행한 데이터다. 표본에서도 과제의 실재성에서도 반대편이 무겁고, 그 사실을 우리 편으로 돌리지 않는다. 다만 그들이 지지한 모형 변종은 「자기 답이 맞았는지 판단하는 능력이 성과에 따라 다르다」는 것이라 치우침이 아니라 정확도 축이고, 함께 견준 다른 변종인 「능력에 대한 사전 신념」 쪽은 우리 후보 ①과 같은 자리에 선다고 우리는 읽는다. 두 후보는 서로를 배제하지 않는다.
우리 계산을 폐기한 이야기부터 해야 한다. 위로 미는 성분의 크기를 조절해 원 논문 수치에 맞춰 보았고, 잘 맞는 조합을 찾았고, 버렸다. 표적이 둘인데 조절 값도 둘이면 답은 정의상 존재한다 — 잘 맞았다는 것이 증거가 되지 못한다. 게다가 치우침을 능력의 함수로 두면 같은 표적을 맞히는 답이 무한히 많고, 그 함수가 곧 후보 ②다. 우리 계산은 세 후보 중 어느 쪽에도 표를 던지지 못한다.
한 가지는 공백으로 남긴다. 잔여분을 설명하려고 조절 값을 하나 더 얹은 모형 비교에 우리 적합과 같은 할인을 매길 수 있는가 — 2021년 연구가 추가 파라미터에 어떤 벌점을 물렸는지 확인하지 못했으므로 그 할인을 그쪽에 옮길 근거가 없다.
그러면 남는 것으로 콜한다. 모양을 걷어낸 뒤에도 남는 어긋남은 실재하지만, 그 정체는 「무능한 쪽의 특수한 과신」보다 「거의 모두가 자기를 위로 놓는 치우침」과 「눈금의 상한」 쪽이라고 우리는 본다 — 사람 쪽보다 재는 방법 쪽이다. 확신도는 낮다. ①은 24년 된 문헌이 세워 두었고, ③에는 전용 논문이 있으며, ②를 가장 가까이 겨눈 검정은 신호를 내지 못했다. 반대쪽이 가진 것은 표본이 훨씬 무거운 모형 비교인데, 그 비교가 지지한 축은 우리가 다투는 축과 다르다.
틀리는 조건을 미리 적어 둔다. 첫째, 응답자가 방금 치른 시험을 대상으로 천 명 이상의 표본에서 오차의 이질성 검정을 돌렸을 때 능력이 낮을수록 오차가 커지는 쪽으로 상관 절댓값이 0.11을 넘겨 유의하게 나오면 우리는 넘어간다. 부호가 반대이거나 그보다 작으면 판정선이 아니다 — 2020년 검정의 신뢰구간이 이미 그 구간을 배제하지 못했다. 둘째, 2021년 연구의 잔여분이 파라미터를 더 얹지 않고 보류 표본이나 교차검증에서 재현됨이 원문으로 확인되면 역시 넘어간다. 여기서 재는 것은 순위를 맞히는 상관(이미 0.3 근방이다)이 아니라 오차 이질성의 상관이다.
반대쪽 과장도 막아야 한다 — 자기평가가 쓸모없다는 결론이다. 2016년 재검정에서 자기평가와 실제 점수의 상관은 0.60이었고 참가자 49%가 자기 점수를 10퍼센트포인트 이내로 맞혔다. 스물두 개 메타분석을 종합한 값도 평균 0.29로 0이 아니다. 순위 정보는 들어 있다. 틀리는 것은 높이다.
0.60과 0.28은 같은 것을 잰 값이 아니다. 앞은 같은 25문항 시험에 대한 항목별 자기평가라 두 도구가 맞물려 설계됐고, 뒤는 자기 IQ 추정과 객관 IQ 검사의 대조다 — 과제가 자기평가 문항에 가까울수록 상관이 올라 같은 그림에 놓지 않는다. 2020년 재검정에 뒤따른 척도 재코딩 반론과 재반박은 원문에 닿지 못했다. 후보 ①의 「균일함」도 관측이 아니라 우리 시뮬레이션이 둔 가정이다.
무엇을 경유로 읽었는가
2026년 7월, 가장 유능한 쪽이 과신을 가장 크게 드러낸다는 연구가 「던닝-크루거를 뒤집었다」는 제목으로 보도됐다. 이 항목은 판단에서 뺐다 — 1차 출처가 저자 소속 대학의 보도자료이고, 저널 원문은 물론 초록에 던닝-크루거가 등장하는지조차 확인하지 못했다.
그러면 반문이 선다. 우리가 세운 세 후보의 근거도 원문을 다 열어 본 것은 아니지 않은가. 맞다. 2002년 논문도 2021년 연구도 원문 PDF를 열지 못했고 서지와 요지를 초록으로 읽었다. 그래서 우리가 긋는 선은 「읽었나」가 아니라 「무엇을 경유로 읽었나」다. 동료심사 저널의 초록과 세 경로에서 일치하는 서지는 대학 홍보실의 보도자료 한 건과 지위가 다르다. 그러고도 남는 약점이 있다 — 우리 콜을 가장 가까이 겨눈 실측은 여전히 검정 하나다. 그래서 확신도를 낮게 박고 깨질 조건을 걸었다.
원 논문이 기술한 것은 아래쪽 구간 집단 평균의 자기평가 오차인데, 한 신문의 표제는 그것을 「무식하면 용감하다」로 옮겼다. 집단의 평균이 개인의 성격 평가가 되는 순간이다. 이런 사례가 몇 건인지는 세지 못했다 — 세 경로에서 전부 막혔다.
순위는 알고 높이를 틀린다
지도의 왜곡은 투영법을 알면 계산으로 걷어낼 수 있고, 걷어낸 뒤에도 그린란드는 남으며, 남은 것의 실제 크기를 알려면 투영이 아니라 다른 측정이 필요하다. 이 곡선도 똑같다.
우리 판단은 두 항이다. 하나, 곡선의 모양은 증거가 아니다. 아무 실력도 들어 있지 않은 숫자로도 같은 X자가 나온다. 확신도 높음. 둘, 남는 어긋남은 실재하지만 그 정체는 「무능한 쪽의 특수한 과신」보다 「거의 모두가 위로 놓는 치우침」과 「눈금의 상한」 쪽이다. 확신도 낮음 — 사람 쪽을 가장 가까이 겨눈 검정은 신호를 내지 못했고 표본의 무게는 반대쪽에 있다. 방금 치른 시험을 대상으로 한 천 명 이상의 표본에서 오차의 이질성이 능력이 낮은 쪽으로 상관 절댓값 0.11을 넘겨 유의하면 우리는 넘어간다.
그래서 교정된 믿음은 이렇다. 던닝-크루거 곡선은 무능한 사람의 초상이 아니라 자기평가라는 척도의 자화상이다 — 그 척도가 만든 모양을 걷어내고 남는 것은 「무능이 과신을 낳는다」가 아니라 「순위는 어느 정도 알지만 높이는 거의 모두가 위로 틀린다」이고, 그 「거의 모두」 안에서 하위가 특별히 더 틀린다는 증거는 그것을 가장 가까이 겨눈 검정에서 서지 않았다.
함의는 이 곡선을 인용하는 방식에서 나온다. 다음에 이 그림을 들 때 모양 자체를 증거로 들지 않는다. 순위와 높이를 갈라서 말한다. 아래쪽 사람들이 특별한가에 대해서는 낮은 확신으로 「특별하지 않은 쪽」에 선다고 말한다. 「무식하면 용감하다」로 옮기지 않는다. 남을 재는 데 쓰던 그림이 실은 우리가 쓰는 척도의 자화상이었다면, 그 그림 안에 서 있는 것은 저 사람만이 아니다.
출처
- Kruger, J. & Dunning, D. (1999). "Unskilled and Unaware of It: How Difficulties in Recognizing One's Own Incompetence Lead to Inflated Self-Assessments." Journal of Personality and Social Psychology 77(6), 1121–1134. — 경유: archive.org 전문 스캔.
- Krueger, J. & Mueller, R. A. (2002). "Unskilled, Unaware, or Both? The Better-Than-Average Heuristic and Statistical Regression Predict Errors in Estimates of Own Performance." Journal of Personality and Social Psychology 82(2), 180–188. — 경유: PubMed·Ovid 초록(원문 미열람).
- Kruger, J. & Dunning, D. (2002). "Unskilled and Unaware — But Why? A Reply to Krueger and Mueller (2002)." Journal of Personality and Social Psychology 82(2), 189–192. — 경유: PubMed 서지(원문 미열람).
- Nuhfer, E., Cogan, C., Fleisher, S., Gaze, E., & Wirth, K. (2016). "Random Number Simulations Reveal How Random Noise Affects the Measurements and Graphical Portrayals of Self-Assessed Competency." Numeracy 9(1), Art. 4.
- Gignac, G. E. & Zajenkowski, M. (2020). "The Dunning-Kruger effect is (mostly) a statistical artefact: Valid approaches to testing the hypothesis with individual differences data." Intelligence 80, 101449.
- Magnus, J. R. & Peresetsky, A. A. (2022). "A Statistical Explanation of the Dunning–Kruger Effect." Frontiers in Psychology 13.
- Jansen, R. A., Rafferty, A. N., & Griffiths, T. L. (2021). "A rational model of the Dunning–Kruger effect supports insensitivity to evidence in low performers." Nature Human Behaviour 5(6), 756–763. — 경유: Princeton 연구자 프로필 초록(원문 미도달).
- Zell, E. & Krizan, Z. (2014). Perspectives on Psychological Science — 자기평가 정확도 22개 메타분석의 메타종합.
- Dawson, C. & de Meza, D. (2026). "Talking the Talk, Not Walking the Walk: The Coevolution of Overconfidence and Loss Aversion." Psychological Review. DOI 10.1037/rev0000644. — 경유: University of Bath 보도자료(2026-07-27) · phys.org. 저널 원문 미도달.
- 아주경제 (2019-12-19). 「[동방인어] '더닝-크루거 효과', 무식하면 용감하다!」
- 자체 시뮬레이션 —
_sim/dk_sim.py(상관 0 재현 · N=1,000 · 시드 30회) ·_sim/dk_sim2.py(격자 탐색). Python 3.14.6 · 표준 라이브러리만 · 동일 시드 재실행 diff=0. 코드·시드·조건 공개.