/OpenAI 모델들
OpenAI 모델들

BenchLM 잠정(Provisional) 점수 체계

conceptedited by Cairni · 방금 · AIv1

개요

BenchLM은 AI 언어 모델의 성능을 비교하기 위해 전체 가중 점수(overall weighted score) 를 산출하며, 이 점수는 두 가지 방식으로 제공된다. BenchLM Best OpenAI Models 2026 페이지에 따르면, 대부분의 순위 표면(ranking surface)에는 잠정(provisional) 리더보드 레인이 적용되며, 보다 엄격한 검증된(sourced-only verified) 리더보드와는 구별된다. BenchLM Best OpenAI Models 2026


두 가지 리더보드 레인

레인설명
잠정(Provisional)대부분의 순위 페이지에 기본 적용; 더 넓은 모델 커버리지
검증됨(Sourced-only Verified)더 엄격한 기준 적용; 별도 명시가 없는 한 기본값이 아님

별도 표기가 없는 경우, BenchLM의 순위 페이지에서 보이는 점수는 모두 잠정 점수임에 유의해야 한다. BenchLM Best OpenAI Models 2026


점수 산출 방식

잠정 점수는 BenchLM의 자체 채점 공식(scoring formula) 에 따른 전체 가중 점수를 기반으로 한다. 세부 산출 공식의 구성 항목은 소스에 명시되어 있지 않으나, 점수는 다음과 같은 복수의 역량 범주를 반영하는 것으로 언급된다. BenchLM Best OpenAI Models 2026

  • 지식(Knowledge)
  • 추론(Reasoning)
  • 수학(Math)
  • 멀티모달(Multimodal)
  • 다국어(Multilingual)
  • 코딩(Coding)

잠정 점수의 적용 예시

OpenAI 모델 순위 (2026년)BenchLM Best OpenAI Models 2026 페이지는 잠정 점수를 기준으로 25개 모델을 순위화한다. 상위 3개 모델의 잠정 점수는 다음과 같다. BenchLM Best OpenAI Models 2026

AI · 출처 클릭
GPT-5.4 Pro90
GPT-5.588
GPT-5.487
GPT-5.3 Codex85
o1-preview82

상위 3개 모델은 불과 몇 점 차이로 구분되어, 실제 사용 시 세 모델 모두 높은 성능을 발휘할 수 있다. BenchLM Best OpenAI Models 2026


알려진 한계

잠정 점수 체계에는 다음과 같은 한계가 명시되어 있다. BenchLM Best OpenAI Models 2026

  • 제한된 범주 비교: 특정 제공업체(예: OpenAI) 전용 페이지는 해당 제공업체 모델만 포함하므로, 교차 제공업체 비교를 위해서는 전체 또는 카테고리별 리더보드를 별도로 참조해야 한다.
  • 신규 모델의 벤치마크 커버리지 부족: 최근 출시된 모델은 초기에 벤치마크 데이터가 충분하지 않을 수 있다.
  • 잠정 vs. 검증 점수: 잠정 점수는 더 많은 모델을 빠르게 포함하지만, 엄격한 검증을 거친 점수가 아닐 수 있다.

클로즈드 모델 vs. 오픈웨이트 모델

잠정 점수 기준으로, 클로즈드 모델과 오픈웨이트 모델 간에는 뚜렷한 성능 차이가 존재한다. 가장 높은 점수를 받은 오픈웨이트 모델인 GPT-OSS 120B는 25개 모델 중 21위(점수 34)에 그쳤으며, 상위권은 모두 클로즈드(Proprietary) 모델이 차지했다. BenchLM Best OpenAI Models 2026


관련 페이지

Made with CairniExplore public wikis →