자산·투자
✓팩트검증✓코드검증validate.py발행 · 유의

매매 알고리즘은 틀려서도 맞아서도 무너집니다 — 성적표를 받는 쪽은 어느 쪽인지 가릴 수 없습니다

2026.09.10·읽기 17분

같은 규칙 97개, 숫자는 둘

주식 수익률을 미리 맞힌다고 학술지에 실린 규칙이 97개 있습니다. 논문이 쓴 기간 밖으로 옮겨 재면 그 규칙들의 수익은 표본 내 대비 26% 줄었습니다. 논문이 실려 세상에 알려진 뒤의 구간에서는 58% 줄었습니다. 규칙도 같고 재는 방식도 같은데 줄어든 폭만 두 배 넘게 벌어집니다.

매매 알고리즘은 사람이 그때그때 정하지 않고 미리 적어 둔 규칙대로 기계가 사고파는 매매입니다. 퀀트, 시스템 트레이딩, 자동매매도 같은 것의 다른 이름입니다. 그 규칙을 과거 데이터에 돌려 「그때 이렇게 했으면 얼마였겠나」를 계산해 보는 것이 백테스트입니다.

미리 적힌 레시피대로만 움직이는 주방을 떠올리면 됩니다. 백테스트는 그 레시피로 어제까지의 장을 다시 봐 주는 일입니다.

매매 알고리즘은 규칙이 틀려서도 무너지고 규칙이 맞아서도 무너지는데, 두 붕괴가 성적에 남기는 흔적이 같아서 성적표를 받는 쪽은 그 알고리즘이 어느 쪽으로 죽었는지 가리지 못한다.

  • 틀려서 무너지는 경로 — 애초에 없던 규칙을 수천 번 훑다가 본 것
  • 맞아서 무너지는 경로 — 진짜 있던 규칙이라 남들도 찾아내 수익이 얇아지고, 끝 구간에서 청산 신호가 겹치는 것
  • 두 경로의 출력이 같다 — 실전 성적에는 둘 다 「계통적으로 낮다」로만 적힌다

규칙을 미리 정해 기계가 실행하는 매매라면 종류를 가리지 않지만, 이 글이 특히 겨누는 것은 계좌 하나로 규칙 하나를 굴리는 쪽입니다.

시험을 많이 볼수록 합격선이 올라가야 합니다

첫째 경로, 규칙이 애초에 없었는데 있는 것처럼 보이는 경우입니다. 한 반 서른 명에게 동전을 열 번씩 던지게 하면 여덟 번 이상 앞면이 나오는 사람이 한 명쯤은 나옵니다. 그 사람이 동전을 잘 던지는 것은 아닙니다. 같은 데이터에 규칙을 여러 개 시험할수록 우연히 좋아 보이는 것이 반드시 나오므로 합격선을 그만큼 올려야 한다는 통계 규율이 다중검정입니다.

한 연구는 새 규칙을 인정하는 문턱을 통상 쓰는 t 통계량 2.0이 아니라 3.0으로 잡습니다. t 통계량은 그 성적이 우연으로 보기 어려운 정도입니다. 이 문턱은 검정들이 서로 독립이라는 가정 위에서 얻은 값이 아니라, 검정 사이 상관을 허용한 채 계산한 값입니다.

시도 횟수가 성적을 얼마나 부풀리는지는 다른 논문이 한 편 안에서 두 번 쟀습니다. 규칙을 고를 때 쓴 데이터가 표본 내, 남겨 둔 데이터가 표본 외입니다. 표본 내에서 최고로 뽑힌 후보가 표본 외로 가면 후보들 성적의 중앙값 아래로 내려앉을 확률, 이것이 백테스트 과적합 확률입니다. 자기 과거 성적이나 시장 평균과 견주는 값이 아니라 함께 시험한 후보들 사이의 순위입니다. 데이터를 여러 토막으로 갈라 만 가지 넘는 조합으로 이 순위를 반복해 셉니다.

같은 논문의 두 예시과적합 확률표본 외 손실 비율
후보 중 표본 내 최고를 고른 합성 전략74%78%
논문이 「실제 투자전략」이라고만 밝힌 예시약 4%약 3%
출처 f3·f5·f6 · 축1 학술 계열 — 같은 논문이 실은 두 예시입니다. 앞 행의 74%는 표본 내 샤프지수가 1에서 3 사이인 후보들에 한정한 값이고, 78%는 그와 다른 눈금입니다(과적합이 아닌 이유로 표본 외 성적이 나쁠 수도 있다고 논문 자신이 적습니다). 뒤 행은 전략 실체·자산군·기간이 전부 비공개라 재현이 안 됩니다.

두 행을 가른 것은 백테스트를 했느냐가 아니라 몇 개를 시험하고 그중 최고를 골랐느냐입니다. 백테스트를 거쳤다는 이유만으로 실전이 무너진다는 강한 버전은 이 데이터가 받치지 않습니다.

성적을 시도 횟수로 깎아 주는 보정치도 이미 있습니다. 다섯 가지 통계량을 함께 반영해 문턱을 다시 잡습니다. 문제는 시행 횟수를 아는 쪽이 규칙을 만든 사람뿐이라는 것입니다. 만든 사람조차 이 보정으로 깎을 수 있는 것은 첫째 경로의 확률뿐이고, 둘째 경로는 그 계산에 들어오지 않습니다.

앞선 글 '하락장 특화' 전략은 정작 하락장에서 원금을 잃는다는 한 전략을 국면마다 다시 재면 결과가 이익에서 손실로 뒤집힌다고 적었습니다. 여기서 파는 축은 한 칸 아래, 애초에 그 규칙이 없었을 수도 있다는 것입니다.

화면의 가격과 체결된 가격

성적이 계통적으로 낮아진다고 할 때, 그 낙차의 일부는 규칙과 상관없이 붙습니다. 중고거래에서 인기 매물에 여럿이 붙으면 값은 올라가고 늦게 붙은 쪽은 더 주거나 못 삽니다. 시장도 같습니다. 내가 사고파는 행위 자체가 가격을 밀어 화면에 보이던 가격보다 불리하게 체결되는 것을 시장충격이라고 부릅니다. 백테스트는 화면의 가격으로 계산하고 실전은 체결된 가격으로 계산하니, 매매가 잦은 규칙일수록 둘 사이가 벌어집니다.

다만 이 비용을 크게 잡는 쪽도 조심해야 합니다. 대형 기관운용사 한 곳이 19개 시장에서 16년간 체결한 1조 달러 규모의 실거래를 뜯어보니, 실제 거래비용은 기존 학술 추정보다 자릿수가 바뀔 만큼 작았습니다. 전략이 감당하는 자금 규모도 훨씬 크게 다시 잡혔습니다. 다만 그 표본은 서두르지 않고 나눠 담는 기관의 집행이라, 매매가 잦은 개인 알고리즘에 그대로 옮겨 붙지 않습니다.

그래서 체결 비용은 두 경로 어느 쪽의 범인도 아니고, 둘 모두에 같은 방향으로 걸립니다. 규칙이 틀렸든 맞았든 실전 성적을 백테스트 성적 아래로 끌어내리고, 낮아진 성적표만으로는 어디까지가 비용이고 어디부터가 규칙인지 갈라 읽을 수 없습니다. 두 경로를 더 닮아 보이게 만드는 공통 부품이 하나 생긴 셈입니다.

「그래도 이기는 알고리즘이 있지 않나」 · 실재합니다. 다만 그 명단은 살아남은 것만 모아 만든 것이고 — 공개 CTA 지수조차 매일 보고 가능한 최대 20개만 편입합니다 — 우위가 서는 곳은 규칙이 아니라 실행 조건입니다. 바로 위의 「자릿수가 바뀔 만큼 작은 비용」이 한 운용사의 실행 품질이었습니다. 규칙을 복제해도 이 부품은 복제되지 않습니다.

널리 쓰이는 규칙일수록 빨리 얇아집니다

직전 체결가 바로 옆에 붙어 있던 주문에는 미치지 않았다

둘째 경로, 규칙이 진짜였던 경우입니다. 방송에 나온 맛집은 줄이 길어져 예전처럼 못 먹습니다. 음식이 나빠진 것이 아니라 아는 사람이 늘어난 것입니다. 규칙이 공개되고 널리 쓰이면 그 규칙이 벌어 주던 수익이 줄어드는 현상이 팩터 감쇠입니다.

서두의 두 숫자가 그 실물입니다. 규칙 97개는 논문 표본 기간 밖에서 26%, 발표 이후에는 58% 줄었습니다.

흔히 이 감소를 결국 과적합이 드러난 결과로 읽습니다. 원장은 두 갈래로 답합니다. 게재본은 표본 밖 감소분 26%를 데이터마이닝 효과가 아무리 커도 그보다는 크지 않다는 상한으로 규정하고, 나머지 32%를 발표 뒤에 붙은 몫으로 돌립니다. 같은 저자들의 초고 판본은 표본을 달리 잡아 데이터마이닝 귀속분을 약 10%로 추정하면서, 그 값이 0과 통계적으로 유의하게 다르지 않다고 적었습니다. 두 판본은 표본도 절단 방식도 달라 한 표에 겹쳐 놓을 수 없습니다. 겹치는 것은 방향 하나입니다 — 어느 쪽으로 세어도 발표 뒤에 붙은 몫이 데이터마이닝 몫보다 크고, 그쪽이 통계적으로 더 단단합니다. 규칙이 틀려서 깎이는 몫이 없다는 말이 아니라, 맞은 규칙에 돈이 몰려서 깎이는 몫이 그 안에 있고 더 크다는 말입니다.

확산에는 두 번째 얼굴이 있습니다. 같은 규칙을 쓰는 돈이 늘면 청산 신호도 같은 순간에 뜨고, 팔겠다는 주문이 쌓이는데 사겠다는 쪽은 물러섭니다. 2007년 8월 초 대형 퀀트 주식 펀드들이 며칠 사이 기록적 손실을 냈을 때, 저자들이 내놓은 설명이 정확히 이것이었습니다. 비슷하게 짜인 포트폴리오들이 동시에 짐을 덜면서 서로의 가격을 밀었다는 것입니다.

아래는 하루 안에서 관측된 수치라 앞의 연 단위 감쇠 추정치와 견줄 값이 아닙니다. 2010년 5월 6일 미국 시장에서, 급락이 시작되기도 전인 오후 2시 30분에 이미 대기 매수 주문의 총량이 그날 아침 대비 E-mini S&P500 선물에서 55%, SPY에서 20% 줄어 있었습니다. 급락 구간에 들어가서는 선물의 매수측 깊이가 아침의 100분의 1 아래로 내려앉았고, 같은 시각 ETF 옵션에서는 검토 대상의 90% 넘는 종목에 형식적 호가만 남았습니다. 다만 보고서는 이 감소가 직전 체결가 바로 옆에 붙어 있던 주문에는 미치지 않았다고 못박습니다 — 얇아진 것은 조금이라도 물러선 가격대입니다.

이것을 알고리즘이 그 하락의 원인이었다는 판정으로 옮기면 안 됩니다. 알고리즘 없이 같은 하락을 겪었다면 어땠을지 견줄 대상이 없어, 확인되는 것은 팔아야 할 때 사 주는 쪽이 얇아졌다는 관측까지입니다.

효과가 있어서 사라지는 실패는 시장 밖에도 있습니다. 잘 듣는 항생제일수록 널리 처방되고, 널리 처방될수록 그 약을 견디는 균이 남습니다.

그래서 「워크포워드나 교차검증으로 과적합은 이미 통제된다」는 반론은 절반만 맞습니다. 규칙을 고를 때 안 쓴 기간으로 다시 시험하는 그 절차들은 첫째 경로의 병을 줄입니다. 줄어드는 것이 첫째뿐이라는 점이 문제입니다. 확산과 동시 청산은 검증 방법론이 손댈 부품이 아니고, 같은 도구와 데이터가 널리 쓰일수록 서로 다른 사람이 같은 규칙에 닿는 속도는 빨라집니다. 더 강한 항생제로 첫째 문제를 덮으면 내성 선택압이 커지듯, 표준 처방이 한 병을 줄이면서 다른 병을 키웁니다.

감쇠는 시장 효율성을 놓고 오래 다퉈 온 주제이지만(행동재무는 무엇이 살아남았나 — 발표가 죽인 알파는 EMH의 승리가 아니라 차익거래의 한계가 그린 지도였다) 여기서는 사슬의 한 부품이고, 둘째 경로의 흔적도 결국 성적이 계통적으로 낮아지는 것으로 나타납니다.

두 붕괴가 성적에 남기는 문장은 같습니다

성적에 남는 것규칙이 없었던 경로규칙이 얇아진 경로
규칙을 고를 때 쓴 구간좋다좋다
규칙을 고를 때 안 쓴 구간계통적으로 낮다계통적으로 낮다
낮아진 까닭없던 것을 봤다같은 규칙에 돈이 몰렸다
성적만 보고 가릴 수 있나아니오아니오
출처 f5·f8 · 축1 학술 계열 — 두 열의 근거는 서로 다른 논문이라 감소폭의 절대값을 견주지 않고 방향만 나란히 놓았습니다. 두 논문 모두 잰 것은 실제 계좌가 아니라 규칙을 고를 때 남겨 둔 과거 구간이고, 우리는 그것을 실전의 대리 지표로 읽습니다.

마지막 줄이 이 글의 급소입니다. 실전의 대리 지표로 읽어도 두 경로는 반대 방향에서 오는데 출력은 한 문장으로 겹칩니다. 원인을 가르려면 성적 말고 다른 관측이 있어야 합니다. 항생제에는 그것이 있습니다. 환자가 낫지 않을 때 애초에 균이 아니었는지 균이 약을 견디게 됐는지를 배양과 감수성 검사로 따로 확인합니다. 매매에는 그런 검사가 없습니다. 표본이 하나여서, 같은 시장을 두 번 살 수 없어 규칙만 빼고 나머지를 그대로 둔 대조군을 만들 방법이 없습니다.

가장 센 반론이 정확히 그 지점을 찌릅니다. 과적합으로 무너진 알고리즘은 첫날부터 안 되고 확산으로 무너진 알고리즘은 한동안 되다가 꺾이니, 성적의 시점 형태가 둘을 가른다는 것입니다.

형태 차이는 원리상 존재합니다. 표본 하나에서 그 형태가 잡음과 구별되지 않는 것이 문제입니다. 성적이 잡음이라면 초기 몇 달이 플러스인 경우도 그만큼 흔하고, 반대로 확산이 이미 진행된 뒤 들어간 알고리즘은 규칙이 맞았는데도 처음부터 부진합니다.

형태로 가르려면 서로 독립인 실전 표본이 여럿 필요하고, 그런 표본은 여러 전략과 시장을 동시에 굴리는 규모에서만 만들어집니다. 그래서 이 한계는 작은 쪽에 세게 걸립니다. 계좌 하나로 규칙 하나를 굴리는 쪽에는 전부 걸리고, 수십 개를 굴리는 쪽에는 일부만 걸립니다. 우리 논지는 이 범위로 한정해 섭니다.

남는 것은 손실이 아니라 실패에서 배우는 통로가 닫혀 있다는 것, 무엇을 고쳐야 하는지 모른 채 다음 규칙을 만들게 된다는 것입니다.

시도 횟수가 안 적힌 성적표는 읽을 수 없습니다

처음의 그 문장 그대로입니다. 그래서 우리 판단은 이렇습니다. 시도 횟수와 체결 비용이 함께 적히지 않은 공개 백테스트 성적은, 그 알고리즘의 실현 성과를 예측하는 정보로 쓸 수 없습니다. 좋아 보이는 성적일수록 규칙의 질보다 탐색의 양을 재고 있을 텐데, 탐색의 양이 안 적혀 있으면 그 둘을 구별할 방법이 읽는 쪽에 없습니다. 확신도는 중간으로 겁니다. 두 경로의 존재는 학술 실측이 받치지만, 개인이 쥔 알고리즘의 실현 성과 통계는 우리가 확인한 범위에서 얇습니다.

2027년 9월 10일까지 다음 중 하나가 관측되면 우리 판단은 틀린 것입니다. ⑴ 국내 로보어드바이저의 공시 실현 수익률 순위가 같은 사업자의 사전 공개 백테스트 순위와 스피어만 순위상관(두 순위표의 순서가 얼마나 닮았는지를 재는 값) 0.3 이상으로, 우연히 그렇게 보일 확률 5% 미만에서 정렬한다. ⑵ 발표 후 팩터 감쇠 폭 추정치가 「사실상 0일 수도 있다」는 범위까지 넓어진다(95% 신뢰구간이 0을 포함한다). ⑶ 실전 성적의 시점 형태만으로 두 경로를 가르는 판별 규칙이 표본 외에서 정확도 70% 이상으로 재현된다.

답하지 못한 것 둘을 남깁니다. 하나는 우리 쪽 한계입니다. 실전 성적의 시점 형태로 두 경로를 가르는 판별자를 다룬 연구에 2026년 9월 10일 검색으로는 닿지 못했습니다. 그런 연구가 없다는 말이 아니라 우리가 닿은 범위에 없었다는 뜻이고, 이 공백은 추정으로 메우지 않습니다. 다른 하나는 데이터 쪽입니다. 한국에서 알고리즘 매매가 얼마나 되는지는 공개 통계가 갈라 주지 않습니다. 규정을 요약한 2차 자료에 따르면 「프로그램매매」는 코스피200 구성종목 15종목 이상을 한 사람이 동시에 매매하는지로, 「알고리즘거래」는 사람 개입 없이 자동화로 하는 거래인지로 각각 다르게 정의된다고 합니다. 자동화 주문이라도 15종목 미만이면 앞에 안 잡히고, 15종목 이상이라도 수동 입력이면 뒤에 안 듭니다. 흔히 인용되는 비중 수치를 논거로 쓰지 않은 이유입니다.

성적표를 받았을 때 먼저 물을 것은 수익률이 아닙니다. 이 숫자가 나오기까지 몇 개의 규칙을 시험했고 그 수가 어디에 적혀 있느냐입니다. 레시피에 안 적힌 것부터 묻는 일입니다.

출처
  1. Campbell R. Harvey, Yan Liu, Heqing Zhu, "…and the Cross-Section of Expected Returns", Review of Financial Studies 29(1), 2016 — https://academic.oup.com/rfs/article/29/1/5/1843824
  2. David H. Bailey, Jonathan M. Borwein, Marcos López de Prado, Qiji Jim Zhu, "The Probability of Backtest Overfitting", 2015 — https://www.davidhbailey.com/dhbpapers/backtest-prob.pdf
  3. David H. Bailey, Marcos López de Prado, "The Deflated Sharpe Ratio", Journal of Portfolio Management, 2014 — https://doi.org/10.2139/ssrn.2460551
  4. R. David McLean, Jeffrey Pontiff, "Does Academic Research Destroy Stock Return Predictability?", Journal of Finance, 2016 — https://papers.ssrn.com/sol3/papers.cfm?abstract_id=2156623
  5. R. David McLean, Jeffrey Pontiff, 같은 연구의 워킹페이퍼 판본, 2012 — https://www.hec.ca/finance/Fichier/McLean.pdf
  6. Andrea Frazzini, Ronen Israel, Tobias J. Moskowitz, "Trading Costs of Asset Pricing Anomalies" — https://papers.ssrn.com/sol3/papers.cfm?abstract_id=2294498
  7. U.S. Securities and Exchange Commission · U.S. Commodity Futures Trading Commission, "Findings Regarding the Market Events of May 6, 2010", 2010-09-30 — https://www.sec.gov/news/studies/2010/marketevents-report.pdf
  8. Robert T. Daigler 외, "The Anatomy of a Crash: Liquidity Black Holes and ETF Options During the Flash Crash of 2010" — https://independent.academia.edu/RDaigler
  9. Amir E. Khandani, Andrew W. Lo, "What Happened to the Quants in August 2007?", NBER Working Paper 14465, 2008 — https://www.nber.org/system/files/working_papers/w14465/w14465.pdf
  10. Société Générale, SG Trend Index / SG CTA Index 지수 방법론
  11. 한국거래소 파생상품시장업무규정(알고리즘거래·고속 알고리즘거래 정의) — 규정 원문 미도달, 2차 요약 경유
이 글은 AI와 함께 다차원으로 분석·검증하고, 작성자가 검수했습니다.