AI
✓팩트검증✓코드검증validate.py발행 · 유의

[기획: AI 트렌드] 오픈웨이트를 발표한 날, 내려받을 가중치는 없었다

2026.10.07·읽기 11분

같은 주, 「오픈웨이트」를 앞세운 두 발표

미국 스타트업 Reflection AI는 10월 5일 새 모델 Beam을 발표하며 자사 첫 「오픈웨이트」 최상위급 모델이라고 소개했습니다. 회사는 Beam을 DeepSeek·Qwen 같은 중국 모델에 맞설 미국 모델로 내세웠습니다. 하루 뒤인 10월 6일에는 Mistral 최고경영자 Arthur Mensch가 아부다비 행사에서 Mistral Large 4를 발표했습니다. Mistral은 정식 출시에 앞서 미리 써 보게 하는 공개 프리뷰를 시작하면서 이 모델을 API로 먼저 내놓았습니다. API는 회사 서버에 질문을 보내고 답만 받아 쓰는 방식입니다.

이런 대형 AI 모델의 본체는 학습으로 정해진 숫자이고, 그 수는 수천억 개가 넘습니다. 숫자 하나하나를 파라미터, 그 숫자들을 통틀어 가중치라 하고, 이를 담은 파일을 가중치 파일이라고 합니다. 요리로 치면 요리법이 아니라 이미 다 끓여 놓은 육수입니다.

오픈웨이트는 이 가중치 파일을 회사 밖 사람도 내려받게 하는 방식이고, 받은 뒤 무엇을 해도 되는지는 라이선스가 정합니다. 학습에 쓴 데이터나 코드까지 공개한다는 뜻은 아닙니다. API가 가게에서 사 먹는 국밥이라면, 오픈웨이트는 육수를 통째로 포장해 주는 것입니다. 포장해 온 육수라면 내 부엌에서 직접 데우고 맛을 따져 봅니다.

큰 병원에 의사가 수백 명 있어도 환자 한 명은 그중 몇 명만 만납니다. Beam과 Large 4도 단어 조각 하나를 처리할 때마다 파라미터 가운데 일부만 씁니다. 이런 구조를 전문가 혼합(MoE)이라고 합니다. 다만 어느 의사가 불릴지 미리 알 수 없으니 병원 전체는 늘 열어 둬야 하듯, 계산은 일부만 해도 가중치 파일 전체는 메모리에 올려 둬야 합니다. Reflection이 밝힌 Beam의 파라미터는 5,010억 개이고, 한 번에 쓰는 활성 파라미터는 230억 개로 전체의 5%가 안 됩니다. Mistral이 밝힌 Large 4도 비율은 그만큼 낮아서, 약 1조 500억 개 가운데 490억 개만 씁니다.

두 발표의 배경에는 중국 모델이 있습니다. 최근 성능 상위권 오픈웨이트 모델은 Kimi, Qwen, GLM, DeepSeek 계열처럼 다수가 중국 회사에서 나왔습니다. Beam과 Large 4는 이에 대한 서구의 대응으로 보도됐습니다.

발표가 먼저, 가중치는 그 뒤에

10월 6일 기준으로 Beam의 가중치는 AI 모델 파일을 올리고 내려받는 사이트인 Hugging Face 등에 올라와 있지 않았습니다. Reflection은 가중치와 기술보고서를 「이달 말」 공개하겠다고 예고했습니다. 로이터 보도에 따르면 Mistral도 약 3주 동안 테스트를 거친 뒤 Large 4 가중치를 일반 공개할 예정입니다. 두 모델 모두 발표가 가중치보다 먼저 나왔습니다.

오픈웨이트의 가치는 누구나 가중치를 내려받아 직접 돌려 보고 잴 수 있다는 데 있습니다. 우리도 다른 글에서 공개된 소형 모델의 가중치를 노트북에 내려받아 속도와 발열을 직접 재 봤습니다맥북 Air M5에서 로컬 LLM 돌리기. 규모는 달라도 가중치가 있어야 직접 돌려 잴 수 있다는 점은 같고, 발표 시점의 Beam과 Large 4로는 누구도 그런 측정을 할 수 없었습니다. 그때의 「오픈」은 육수를 포장해 주겠다는 예고였고, 포장된 육수는 아직 없었습니다.

가중치 공개를 미루는 쪽에도 사정은 있습니다. Reflection은 공개 전 최종 레드팀을 진행하고 있다고 밝혔습니다. 레드팀은 모델을 일부러 공격하고 악용해 보며 위험을 찾는 점검입니다. 우리는 이 시차를 흠으로 보지 않습니다. 따질 것은 시차 자체가 아니라 그 사이 무엇을 확인할 수 있었느냐입니다.

발표만 보고 앞질러 적은 곳도 있습니다. 우리가 검색으로 확인한 바로는 llm-stats 류의 일부 AI 모델 집계 사이트가 발표 당일 Large 4를 이미 출시된 오픈웨이트 모델로 적었습니다. 가중치가 아직 나오지 않은 상태와 어긋나는 서술입니다.

발표와 가중치 사이, 잴 수 있었던 숫자

Beam이 발표된 10월 5일, TechCrunch는 Beam의 성능 주장이 아직 독립 검증 전이라고 적었습니다. 독립 측정은 회사가 아닌 제3자가 여러 모델을 같은 조건으로 재서 매긴 점수이고, 회사가 직접 재서 밝힌 점수는 자기보고라고 부릅니다. 학교로 치면 시험 조건을 남이 정한 시험과 자기가 정한 시험의 차이입니다.

우리가 찾은 Beam의 성능 숫자는 모두 Reflection의 자기보고입니다. 모델에게 풀게 해 성능을 재는 같은 문제 묶음을 벤치마크라고 합니다. Reflection이 밝힌 Beam의 코딩 벤치마크 SWE-bench Verified 점수는 80.9입니다. 어떤 도구를 쓰게 하고 어떤 환경에서 쟀는지는 우리가 확인하지 못했습니다. Reflection은 또 Beam이 「GLM-5.2급 추론 성능을 추론 연산 3~4배 적게」 낸다고 밝혔습니다. 비슷한 성능을 내면서 답을 만드는 데 드는 계산은 그만큼 적다는 주장입니다. 비교 대상인 GLM 계열도 전문가 혼합 구조여서, 계산을 어디서 줄였는지는 이 숫자만으로 알 수 없습니다. 이 역시 회사가 잰 숫자입니다.

Beam 발표에는 가중치가 없었고, 발표 반응을 전한 글들에 따르면 API도 열리지 않았습니다. 개발자들이 모이는 게시판 Hacker News 토론에는 「가중치부터 보여 달라」는 불만이 올라왔습니다. 이 토론과 AI 뉴스레터 Latent Space에서는 성능보다 문제 하나를 해결하는 데 드는 비용으로 비교해야 한다는 지적도 나왔습니다.

Large 4는 사정이 달랐습니다. API가 먼저 열려 있었고, 같은 주 두 모델 가운데 독립 측정을 받은 모델은 우리가 찾은 범위에서 Large 4뿐이었습니다. 독립 벤치마크 업체 Artificial Analysis가 발표 당일 프리뷰 API로 잰 Large 4의 종합 점수(Intelligence Index)는 38이었습니다. 여러 시험을 묶어 매긴 점수라 사람의 지능지수(IQ)와는 척도가 다릅니다. 같은 점수에서 중국의 GLM-5.3은 44.8이었습니다. GLM-5.3의 값은 답하기 전 생각하는 단계를 가장 길게 쓰게 한 설정으로 잰 것입니다.

프리뷰 API로 잰 이 측정에서 Large 4는 측정 업체가 오픈웨이트로 분류한 모델 가운데 8위였고, 앞선 7개는 모두 중국 모델이었습니다. 중국 밖 모델로 좁히면 오픈웨이트 모델 중 최상위입니다. 같은 측정에서 지수 평가 과업 하나에 든 비용은 0.57달러로, 지능이 비슷한 오픈웨이트 모델보다 4배 이상 비쌌습니다.

「8위」와 「중국 밖 최상위」는 같은 측정에서 함께 나온 결과입니다. 로이터 보도에 따르면 Mensch도 새 모델이 「일부 영역」에서 중국 모델을 앞선다고 범위를 좁혀 말했습니다. 개발자 Simon Willison은 자기 블로그에서 Mistral이 가장 앞선 모델들보다 약 6개월 뒤처진 위치로 돌아왔다고 평했습니다. 중국 회사 모델을 쓰기 어려운 기업이라면 「중국 밖 최상위」가 실제 비교 기준이 됩니다. 성능과 비용을 함께 따진다면 중국 모델과 견준 순위와 비용 차이가 기준입니다.

Large 4가 독립 측정을 받았다고 해서 오픈웨이트의 약속까지 확인된 것은 아닙니다. 이 점수는 Mistral 서버에 문제를 보내고 받은 답으로 잰 성능입니다. 가중치를 내려받아 직접 돌릴 수 있는지, 공개될 가중치가 프리뷰 API로 잰 모델과 같은지는 가중치가 나와야 확인됩니다. 어떤 조건으로 쓸 수 있는지는 라이선스, 즉 받은 사람이 가중치로 무엇을 해도 되는지 정한 이용 조건 문서가 나와야 확인됩니다. Large 4의 라이선스는 회사가 따로 정한 「커스텀 Mistral 라이선스」로 보도됐고, 우리는 그 문면을 확인하지 못했습니다.

가중치가 도착하면 확인할 것

로이터 보도에 따르면 Mistral은 10월 27일 Large 4 가중치를 일반 공개할 예정입니다. Beam 가중치도 이달 말 공개가 예고돼 있습니다. 두 파일이 올라오면 확인할 사실은 셋입니다.

  • 배포 사이트 등재. Hugging Face 같은 사이트에 가중치 파일이 실제로 올라오는지 봅니다. 발표 시점에는 두 모델 모두 예고뿐이었습니다.
  • 라이선스 문면. Reflection은 Beam을 널리 쓰이는 공개 라이선스인 Apache 2.0으로 내겠다고 예고했습니다. Large 4는 커스텀 라이선스로 보도됐는데, 직전 모델 Large 3은 Apache 2.0이었습니다. Large 4 문서에서 무엇이 달라졌는지가 확인 대상입니다.
  • Beam의 독립 측정. 가중치가 공개되면 제3자도 Beam을 직접 잴 수 있습니다. Reflection이 밝힌 숫자와 견줄 독립 점수가 나오는지 봅니다.

가중치가 오기 전인 지금, Beam의 성능 숫자는 회사가 밝힌 숫자뿐이고 독립 측정은 API를 먼저 연 Large 4에만 있습니다. 같은 주의 두 발표에서 「오픈」은 발표일에 확인되는 사실이 아니었습니다. 오픈웨이트인지는 가중치 파일이 도착한 날, 얼마나 열려 있는지는 라이선스 문면이 나온 날 확인됩니다. 다음에 「오픈웨이트 모델 출시」라는 제목을 만나면, 내려받을 파일이 이미 있는지부터 확인하면 됩니다.

유의"루틴 1회차 · 원문 개봉 0(egress 차단 · 원장 22행 전부 검색요약 경유 · f17·f20 링크 미확보 · 출처 절 명시) · 렌즈 발견 원문 reviews.md 미기록(decisions
출처
  1. 기준일 = 2026년 10월 7일 오전(한국 시간).
  2. 이번 정리는 각 회사 발표·측정 페이지와 보도 원문을 직접 열지 못했고, 검색 결과에 실린 보도 요약을 거쳐 확인했습니다.
  3. Beam 발표(2026-10-05) — 첫 오픈웨이트 모델 소개·규모·자기보고 점수·가중치 공개 예고·레드팀 진행 Reflection AI 블로그
  4. Beam 보도 — 중국 모델 대항 포지셔닝·가중치 미배포·「독립 검증 전」·효율 주장 TechCrunch(2026-10-05)
  5. Beam 규모·구조·코딩 점수 요약 MarkTechPost(2026-10-05)
  6. Beam 발표 반응 — 「가중치부터」 불만·해결 건당 비용 지적 Hacker News 토론
  7. Beam 규모 요약·반응 정리 Latent Space
  8. Large 4 발표(2026-10-06) — 공개 프리뷰·규모·가중치 공개 계획 Mistral
  9. Mensch 발언(「일부 영역」)·가중치 공개 예정일·라이선스 보도 로이터 기사 재전송, KFGO(2026-10-06)
  10. Large 4 규모·가중치 공개 계획·라이선스 보도 VentureBeat
  11. 독립 측정 — Intelligence Index v4.3.2 점수·오픈웨이트 모델 순위·과업당 비용(프리뷰 API · 비교 모델은 최대 추론 설정) Artificial Analysis
  12. 독립 측정 보도 Unite.AI
  13. Simon Willison의 평(2026-10-06) simonwillison.net
  14. Large 4 규모·구조 요약 MarkTechPost(2026-10-06)
  15. GLM 계열의 전문가 혼합 구조(GLM-5 기술보고서) — 검색 요약 경유 arXiv 2602.15763
  16. 직전 모델 Large 3의 규모·라이선스(2025-12) — TechCrunch 2025-12-02 보도의 검색 요약 경유(링크 미확보)
  17. 발표 당일 Large 4를 「출시된 오픈웨이트」로 적은 집계 사이트 서술 — llm-stats 류 집계의 검색 요약 경유(링크 미확보)
  18. 우리 이전 글 맥북 Air M5에서 로컬 LLM 돌리기
이 글은 AI와 함께 다차원으로 분석, 검증하고 집필자가 검수했습니다.