Cloudflare 결정 모델 Clef 공개, 가중치는 무료인데 호스팅은 Jev의 5.7배
Cloudflare가 결정 모델 Clef와 Clef-flash를 Apache 2.0으로 공개했습니다. 자체 지표 종합은 Clef 61.2로 Jev 57.9를 넘지만, Workers AI 입력 단가는 100만 토큰 0.24달러로 Jev의 0.042달러보다 5.7배 비쌉니다.
- Cloudflare가 결정 모델 Clef를 Apache 2.0으로 공개했습니다.
- 자체 지표 종합은 Clef 61.2, Jev 57.9, Clef-flash 57.1입니다.
- 가중치는 무료지만 Workers AI 단가는 Jev의 5.7배입니다.
10월 1일 Cloudflare가 Clef와 Clef-flash 두 모델을 Hugging Face에 Apache 2.0으로 올리고 같은 모델을 Workers AI에서 호출할 수 있게 열었습니다. Cloudflare가 직접 학습해 내놓은 첫 모델입니다.
두 모델은 글을 쓰지 않습니다. 고객 문의 하나와 "어느 팀이 맡을까", "급한 건인가" 같은 질문을 함께 넣으면, 답을 문장으로 풀어 쓰는 대신 선택지마다 확률을 붙여 돌려줍니다. 티켓 분류, 요청 라우팅, 안전 게이트처럼 답이 이미 정해진 목록 안에 있는 일을 LLM 대신 맡습니다. 이런 모델을 결정 모델이라고 부릅니다. 이름은 9월 15일 TypeSafe AI가 Jev를 공개하면서 붙었습니다.

3주 전만 해도 이 범주에서 쓸 만한 모델은 Jev 하나였습니다. 9월 23일 공개된 Ollaya가 Jev API를 그대로 받는 로컬 서버를 열었지만 거기서 돌릴 수 있는 오픈 모델의 정확도는 laya:en 0.361에서 kev:9b 0.722까지로 Jev에 미치지 못했습니다. Clef는 오픈 가중치 모델 중 처음으로 Jev보다 높은 점수를 들고 나왔습니다.
Jev보다 분류에서 앞서고 판단에서 뒤집니다
Cloudflare가 쓰는 자체 종합 지표 Decision Index 0.2.1에서 Clef는 61.2, Jev는 57.9입니다. 작은 쪽인 Clef-flash는 57.1로 Jev보다 0.8점 낮습니다. 대신 중앙값 지연이 Clef-flash 38.8밀리초, Jev 524.1밀리초로 같은 판정을 13배 빨리 돌려줍니다. 27B인 Clef는 209.3밀리초입니다.

차트 범례를 함께 읽어야 합니다. Cloudflare는 자사 모델 점수를 self-reported, 다른 오픈 모델 점수를 board-validated로 구분해 표시했습니다. Clef의 61.2는 Cloudflare가 직접 잰 값입니다.
벤치마크를 하나씩 보면 Clef가 이기는 쪽과 지는 쪽이 갈립니다.
| 벤치마크 | Clef | Clef-flash | Jev |
|---|---|---|---|
| BANKING77 (의도 분류) | 94.20 | 90.93 | 79.74 |
| BFCL (도구 선택) | 98.47 | 98.76 | 95.75 |
| PhishNChips (피싱 판정) | 79.60 | 75.05 | 62.55 |
| CLINC150+OOS (의도 분류) | 97.43 | 66.77 | 89.27 |
| When2Call (행동할지 되물을지) | 72.37 | 65.58 | 80.97 |
| BRIGHT (추론형 검색) | 45.91 | 39.26 | 47.52 |
Clef가 크게 앞서는 쪽은 의도 분류와 도구 선택입니다. 은행 고객 문의를 77개 의도로 나누는 BANKING77에서 94.20 대 79.74로 14점 이상 벌렸고 피싱 판정에서도 79.60 대 62.55입니다. 답이 입력 안에 들어 있고 알아보기만 하면 되는 과제입니다.
Jev가 이기는 두 벤치마크는 성격이 다릅니다. When2Call은 에이전트가 지금 도구를 부를지, 사용자에게 되물을지, 거절할지를 고르는 과제이고 Jev가 80.97, Clef가 72.37입니다. 추론형 검색 BRIGHT도 Jev가 47.52로 앞섭니다. 입력에 답이 없고 상황을 가늠해야 하는 쪽에서는 Jev가 아직 낫습니다.
Clef-flash를 속도만 보고 고르면 곤란한 자리도 있습니다. CLINC150+OOS에서 Clef가 97.43인데 Clef-flash는 66.77입니다. 30점이 넘는 차이입니다. 이 벤치마크는 정해진 의도 목록에 없는 질문을 걸러내는 능력을 봅니다.
제원에서 Jev보다 나은 부분도 있습니다. 컨텍스트가 Jev의 32k에서 65,536 토큰으로 늘었습니다. Jev가 텍스트만 받는 것과 달리 Clef는 비전 인코더가 있어 요청당 이미지 4장까지 함께 판정합니다. 질문 유형은 Jev와 같은 세 가지(noul, choice, score)이고 요청 하나에 질문 64개까지 넣습니다.
가중치는 공짜인데 Cloudflare에서 돌리면 Jev의 5.7배
Clef를 쓰는 방법은 두 가지이고 값이 정반대입니다.
가중치는 Hugging Face Cloudflare/clef와 Cloudflare/clef-flash에서 Apache 2.0으로 내려받습니다. 호출 요금이 0원이고 판정할 텍스트가 내 서버를 떠나지 않습니다. 대신 돌릴 GPU가 필요합니다. 모델 카드가 검증한 환경은 27B 기준 단일 H200입니다.
Workers AI 호스팅은 요금이 붙습니다. 입력 100만 토큰에 Clef 0.24달러, Clef-flash 0.09달러이고 출력은 과금하지 않습니다. 돌려주는 것이 숫자 몇 개뿐이라 셀 값이 없다는 이유로 Jev와 같은 과금 구조입니다.
| 쓰는 방법 | 입력 100만 토큰 | Jev 대비 | 판정 100만 건 |
|---|---|---|---|
| Jev (TypeSafe) | 0.042달러 | 기준 | 약 12.6달러 |
| Clef-flash (Workers AI) | 0.09달러 | 2.1배 | 약 27달러 |
| Clef (Workers AI) | 0.24달러 | 5.7배 | 약 72달러 |
| 자가 호스팅 | 0달러 | GPU 비용만 | GPU 비용만 |
맨 오른쪽 열은 Hacker News 스레드가 가장 먼저 한 계산입니다. 호출 하나에 입력 300토큰을 가정하고 100만 건을 돌리면 Jev는 약 12.60달러, Clef는 약 72달러입니다. 같은 스레드에서 자가 호스팅 경제성을 두고 반론이 오갔습니다. Havoc은 "프라이버시 때문이라면 몰라도 가격만 보면 규모와 산업용 전기 요금을 가진 데이터센터를 이기기는 어렵다"고 적었습니다. otabdeveloper4는 "AWS에 대해서도 원래 그렇게들 말했지만 알고 보니 AWS가 직접 데이터센터를 빌리는 것보다 10배쯤 비싸다"고 받았습니다.
가중치만 열렸다는 점도 바로 지적됐습니다. 학습 데이터와 파이프라인은 공개되지 않았습니다. 같은 날 Apache 2.0으로 나온 Amazon의 Strands Decider 2B가 학습 데이터와 스크립트까지 함께 공개한 것과 다릅니다. 다만 Strands Decider 2B는 약 2B 모델이라 AWS 문서가 스스로 어려운 문제에서 정확도 0.505, 즉 동전 던지기 수준이라고 적었습니다.
지금 쓸 수 있는 조건
대기자 명단이 없습니다. Cloudflare 계정과 API 토큰만 있으면 오늘 호출됩니다.
| 항목 | 내용 |
|---|---|
| 대상 | 개발자. Workers AI 호출에는 Cloudflare 계정 필요, 가중치 내려받기는 계정 없이 가능 |
| 무료 한도 | 하루 10,000 뉴런. Clef 약 45.8만, Clef-flash 약 122만 입력 토큰에 해당 |
| 초과 요금 | 유료 플랜에서 1,000 뉴런당 0.011달러 |
| 한국 사용 | 가능. 국가 제한 없음. 다만 추론 GPU 위치는 비공개 |
| 필요 조건 | 대기자 명단 없음. 자가 호스팅은 27B가 H200급, 9B는 24GB급 GPU |
한국에서 쓸 때 걸리는 조건은 요금이 아니라 추론이 도는 위치입니다. Cloudflare는 GPU를 둔 도시를 공개하지 않고 요청을 같은 대륙 안의 GPU 보유 데이터센터로 보냅니다. Workers AI에는 데이터 현지화 보장이 따로 없습니다. 고객 문의 원문이나 개인정보가 섞인 텍스트를 판정에 넣는다면 처리 위치를 계약서에 적어야 합니다. 그럴 때는 서울 리전 밖으로 나가지 않는 Bedrock 구성처럼 리전을 명시하는 서비스를 쓰거나, Apache 2.0 가중치를 직접 돌리는 쪽이 맞습니다.
Workers AI 바인딩에서 호출하는 모양은 Jev SDK와 같습니다.
const response = await env.AI.run("@cf/cloudflare/clef", {
state: "결제가 한 시간째 모든 고객에게서 실패하고 있습니다.",
questions: {
urgent: { type: "noul", instructions: "급한 요청인가" },
team: {
type: "choice",
instructions: "어느 팀이 맡아야 하나",
criteria: {
billing: "결제, 청구서, 환불",
technical: "장애, 오류, 설정",
sales: "요금제와 업그레이드",
},
},
},
});
Cloudflare는 Clef를 도메인에 맞게 조정하는 강화학습 미세조정 서비스 RLCD도 함께 알렸습니다. 초기에는 Cloudflare FDE 팀과 함께 진행하고 나중에 셀프서비스로 연다고만 적었고 신청 창구와 가격은 아직 없습니다.
이미 Jev로 티켓 분류나 요청 라우팅을 돌린다면, 운영 로그에서 최근 질의 200건을 뽑아 같은 스키마를 @cf/cloudflare/clef-flash에 던지고 기존 판정과 일치율을 재보는 것이 첫 단계입니다. 무료 할당이 Clef-flash 기준 하루 약 122만 입력 토큰이라 200건 비교에는 요금이 들지 않습니다. 다만 에이전트가 행동할지 되물을지 고르는 경로라면 When2Call 점수가 Jev 80.97, Clef 72.37이므로 그 호출은 그대로 두는 편이 낫습니다.