Devlery
Blog/Open Source

OpenRouter 같은 모델도 호스트 따라 도구 호출 30점 차, 기본 라우팅은 69.9%

OpenRouter 자체 32일 벤치마크에서 DeepSeek V4 Flash 0731의 TAU-Bench 점수가 호스트별로 76.8%부터 46.4%까지 갈렸습니다. 운영자 실측 글이 HN 1위에 오르자 OpenRouter는 QoS 등급 도입을 예고했습니다.

OpenRouter 같은 모델도 호스트 따라 도구 호출 30점 차, 기본 라우팅은 69.9%
AI 요약
  • 같은 DeepSeek 모델도 OpenRouter 호스트마다 도구 호출 점수가 30.4점 갈립니다.
  • 하루 토큰 60%는 도구 호출 70%대 초반인 최저가 두 호스트에 몰립니다.
  • OpenRouter는 QoS 등급을 예고했지만 시점과 가격은 미정입니다.

오픈 웨이트 모델을 OpenRouter로 부르면 같은 모델 이름을 보냈으니 같은 답이 온다고 생각하기 쉽습니다. iMessage 안에서 동작하는 AI 비서 Olly를 만드는 Mo Moustafa가 9월 7일 올린 「So you want to use OpenRouter?」그 가정이 틀렸다는 실측입니다. 이 글은 9월 11일 Hacker News 1면에서 642점으로 가장 높은 점수를 받았고 OpenRouter 공동창업자가 댓글로 직접 답했습니다.

OpenRouter는 모델 이름 하나로 요청을 보내면, 그 모델을 서버에 올려 둔 여러 회사(이하 호스트) 가운데 한 곳으로 대신 보내 주는 중개 API입니다. 1억1300만 달러를 조달한 모델 라우터로 이미 다룬 적이 있습니다. DeepSeek V4 Flash 0731 한 모델만 해도 호스트가 30곳이 넘습니다. 호스트들은 같은 가중치를 받아 돌리는데 결과는 같지 않았습니다.

30.4점
같은 모델, TAU-Bench 최고 호스트와 최저 호스트의 차이
8.25배
같은 모델, 가장 비싼 호스트와 가장 싼 호스트의 출력 가격 차이
60.4%
최저가 두 호스트가 가져간 하루 토큰 비중

수치는 모두 DeepSeek V4 Flash 0731 기준이고, OpenRouter 모델 페이지를 9월 11일에 열어 확인했습니다.

같은 가중치인데 도구 호출 점수가 30점 갈린다

Moustafa는 Olly에서 쓰는 모델 4종(DeepSeek V4 Flash 0731, GLM-5.3 Flash, Qwen 3.5 122B, MiniMax M3)을 모델마다 호스트 20곳 안팎에서 비교했습니다. Olly는 누적 메시지가 1800만 건을 넘고 그중 약 3분의 1이 OpenRouter를 거칩니다.

가장 큰 차이는 에이전트가 도구를 제대로 부르는지 재는 TAU-Bench에서 나왔습니다. DeepSeek V4 Flash 0731은 DeepSeek 자체 서버에서 81.3%, DigitalOcean에서 58.4%였습니다. 7월에는 Fireworks가 46%까지 내려가 차이가 35점이었습니다. 지식 문제를 푸는 GPQA에서도 DeepSeek 90.2%, DigitalOcean 75.3%로 15점이 났습니다.

에이전트에게는 TAU가 중요한 점수이고, 20점 차이는 잡음이 아니다. (Mo Moustafa)

한 사람의 측정만은 아닙니다. OpenRouter는 모델 페이지 Performance 탭에 호스트별 GPQA Diamond와 TAU-Bench Airline 점수를 32일 이동평균으로 공개합니다. 이 기간은 OpenRouter가 품질 기준으로 호스트를 고를 때 쓰는 기간과 같습니다.

OpenRouter DeepSeek V4 Flash 0731 모델 페이지의 AutoExacto Benchmarks 표. 호스트별 32일 이동평균 GPQA Diamond와 TAU-Bench Airline 점수가 나열돼 있다

표에는 호스트 33곳과 'auto-routing' 행 하나가 있습니다. 가격과 트래픽 비중을 함께 놓으면 다음과 같습니다.

호스트TAU-BenchGPQA출력 100만 토큰하루 토큰 비중
Alibaba Cloud Int.76.8%89.4%0.528달러0.4%
NextBit76.6%89.9%1.056달러0.1%
CoreWeave76.3%87.1%0.28달러4.1%
Cloudflare74.6%88.3%1.32달러0.1%
DeepInfra73.8%89.2%0.18달러7.7%
Relace71.7%87.2%0.18달러36.9%
OpenInference70.8%70.5%0.16달러23.5%
auto-routing69.9%84.4%--
DigitalOcean46.4%72.1%0.252달러0.6%

출처: OpenRouter DeepSeek V4 Flash 0731 모델 페이지(2026-09-11 확인). 점수는 32일 이동평균, 가격은 호스트 등재가, 비중은 최근 1일 토큰 기준. 음영은 최저가 두 곳.

가장 높은 Alibaba Cloud Int.(76.8%)와 가장 낮은 DigitalOcean(46.4%)은 30.4점 차이입니다. 원문 시점 수치(81.3% 대 58.4%)와 절대값은 다릅니다. OpenRouter 표는 32일 평균이고, 9월 11일 목록에는 DeepSeek 자체 엔드포인트가 빠져 있습니다. DigitalOcean이 맨 아래라는 결과는 같습니다.

트래픽 60%는 가장 싼 두 곳에 있다

OpenRouter 문서에 따르면 sortorder를 지정하지 않은 요청은 싼 호스트를 먼저 고릅니다. 최근 30초 동안 장애가 없던 호스트 가운데 가격 제곱에 반비례하는 비율로 나눕니다. 이 계산대로면 가격이 두 배인 호스트는 4분의 1 비율로만 선택됩니다.

같은 모델의 출력 가격은 OpenInference 0.16달러부터 Cloudflare·Baidu Qianfan 1.32달러까지 8.25배 차이가 납니다. 9월 11일 하루 토큰 비중은 Relace 36.9%, OpenInference 23.5%로 두 곳이 60.4%를 가져갔습니다. 두 곳 모두 최저가 구간에 있고 TAU-Bench는 71.7%와 70.8%입니다. 상위 세 곳(76%대)보다 5점에서 6점 낮습니다. OpenInference는 GPQA가 70.5%로 Alibaba Cloud Int.(89.4%)보다 약 19점 낮습니다.

비싼 호스트가 정확한 것도 아닙니다. 출력 1.32달러인 Cloudflare는 74.6%인데, 그 40% 가격인 0.528달러의 Alibaba Cloud Int.가 76.8%로 1위입니다. 가격표로는 품질을 고를 수 없습니다.

OpenRouter도 이 문제를 알고 있습니다. 3월 12일부터 도구가 들어간 요청에는 Auto Exacto가 기본으로 켜집니다. 처리량, 도구 호출 성공률, 자체 벤치마크 점수를 보고 호스트 순서를 다시 매기는 기능입니다. 발표 당시 GLM-5의 도구 호출 오류율이 8%에서 약 1%로 줄었다고 밝혔습니다.

적용 범위에는 한계가 있습니다.

  • 도구가 없는 요청은 여전히 가격 가중치를 따릅니다. 품질 우선 라우팅을 쓰려면 모델 이름 뒤에 :exacto를 붙여야 합니다.
  • sort: "price"를 넣거나 모델 이름에 :floor를 붙이면 Auto Exacto가 꺼집니다.
  • 표 아래쪽 'auto-routing' 행은 TAU-Bench 69.9%로 1위 호스트보다 6.9점 낮습니다. 이 행이 어떤 설정으로 잰 값인지는 페이지에 설명이 없습니다.

점수표에 안 잡히는 실패

Moustafa가 겪은 실패 상당수는 HTTP 200 응답 안에 숨어 있었습니다. 에러 코드가 없으니 재시도 로직도 돌지 않습니다.

  • 이미지 입력: DeepInfra의 Qwen3.5는 글자 K를 R로, 빨간색을 파란색으로 답했습니다. Venice와 Together의 MiniMax는 이미지 지원을 표시해 놓고 "이미지가 없다"고 응답했습니다.
  • 추론 강도: reasoning.effort를 바꿔도 DigitalOcean, GMICloud, Mancer, Venice는 추론량이 달라지지 않았습니다. 호스트를 고정하고 같은 프롬프트를 강도마다 3번씩 보낸 결과입니다.
  • 빈 응답: 7월 StreamLake는 DeepSeek 트래픽의 20%를 받으면서 빈 응답의 92%를 냈습니다.
  • 도구 호출 파싱: 구조화된 도구 호출 대신 <use_skills><parameters> 같은 원시 태그가 본문 텍스트로 돌아왔습니다.
  • IP 기반 제한: Venice와 Novita는 개인 Mac에서는 정상이었는데 운영 서버에서 보낸 요청은 거의 모두 429로 막혔습니다.

흔히 쓰는 우회책도 통하지 않았습니다. quantizations로 fp8 호스트만 받게 해도 품질은 나아지지 않았습니다. fp4 호스트와 fp8 호스트가 점수 순위 전체에 섞여 있었기 때문입니다. Moustafa는 "정밀도는 품질의 나쁜 대리 지표이고, 강제 필터는 후보만 줄인다"고 적었습니다.

호스트를 고정한 실험도 막혔습니다. Cloudflare, Baidu, Alibaba 세 곳을 order로 지정하고 allow_fallbacks: false로 대체 경로를 막았습니다. 그러자 Baidu가 요청을 제한했고 Cloudflare는 모델을 내렸으며 Alibaba마저 제한을 걸어 서비스가 멈췄습니다.

OpenRouter의 답과 남은 빈칸

OpenRouter 공동창업자이자 COO인 Chris Clark(HN 아이디 numlocked)는 댓글에서 운영 방식을 설명했습니다.

  • 라이브 엔드포인트에 벤치마크를 계속 돌리고, 중앙값에서 표준편차 이상 벗어난 호스트는 기본 라우팅 풀에서 뺍니다.
  • 도구 호출을 자주 잘못 파싱하는 호스트는 실시간으로 우회합니다.
  • 양자화 필터는 "레거시 개념"이니 쓰지 말라고 했습니다.

빈칸도 인정했습니다. 응답 종료 사유가 error면 비용을 OpenRouter가 부담하지만 내용이 비었어도 stop으로 끝나면 사용자가 냅니다. 공급자 관계 팀장(pingtoven)은 DeepInfra가 7월 등재 때 통과한 이미지 테스트를 지금은 통과하지 못한다고 확인했습니다. 이미지와 추론 강도 테스트는 상시로 돌리겠다고 했습니다.

Clark는 "프로덕션 앱을 위한 QoS 등급을 도입한다"고 예고했습니다. 시점과 가격은 밝히지 않았습니다. 지원 인력이 "매우 부족하다"는 말도 남겼습니다.

지금 설정으로 할 수 있는 것

QoS 등급이 나오기 전에도 요청 본문의 provider 옵션으로 호스트를 직접 고를 수 있습니다. 개발자에게 해당하는 내용입니다.

항목내용
대상API 키를 쓰는 개발자. provider 옵션은 모든 계정에서 요청 본문에 넣으면 적용
가격호스트 가격을 그대로 전달(마크업 없음). 크레딧 구매 수수료는 카드 5.5%(최소 0.80달러), 암호화폐 5%
한국 사용가능. 약관은 모델 제공사가 막은 지역의 모델만 제한하고 한국 제한 언급은 없음. EU·미국 지역 내 라우팅은 Business·Enterprise 전용
QoS 등급예고만 있고 시점·가격 미정

도구 호출이 중요한 에이전트라면 TAU-Bench 상위 호스트를 순서대로 지정하는 설정부터 시작할 만합니다.

{
  "model": "deepseek/deepseek-v4-flash-0731",
  "provider": {
    "order": ["alibaba", "nextbit", "coreweave"],
    "require_parameters": true,
    "allow_fallbacks": true
  }
}

order는 시도 순서입니다. 호스트 이름 표기는 모델 페이지 Providers 탭에서 확인합니다. require_parameters: true는 요청에 넣은 파라미터를 모두 지원하는 호스트만 쓰게 합니다. 문서상으로는 지원 여부로 거르는 옵션이라, 지원한다고 표시하고 실제로는 무시하는 호스트까지 막아 준다는 보장은 없습니다. allow_fallbacks는 켜 둡니다. Moustafa처럼 끄면 지정한 세 곳이 한꺼번에 막힐 때 대체 경로가 없습니다.

도구를 부르는 에이전트를 OpenRouter의 오픈 웨이트 모델로 돌리고 있다면, 쓰는 모델 페이지의 Performance 탭에서 AutoExacto Benchmarks 표를 열어 TAU-Bench 상위 세 곳을 order에 넣어 보세요. 그다음 운영 서버에서 일주일 동안 호스트별로 내용이 빈 200 응답 비율을 기록해 보세요. 기본 라우팅 시절과 비교할 숫자가 생기면, 싼 호스트에서 아낀 토큰값이 실패한 대화의 비용보다 큰지 판단할 수 있습니다.