Devlery
Blog/Open Source

환경변수 하나로 Jev를 로컬로 옮기는 Ollaya, 정확도는 모델 따라 0.361과 0.722

9월 23일 공개된 Apache-2.0 런타임 Ollaya가 TypeSafe Jev의 API를 그대로 받습니다. 공식 SDK는 환경변수 한 줄로 로컬 서버에 연결되고, 오픈 결정 모델의 정확도는 laya:en 0.361에서 kev:9b 0.722까지 벌어집니다.

환경변수 하나로 Jev를 로컬로 옮기는 Ollaya, 정확도는 모델 따라 0.361과 0.722
AI 요약
  • Jev를 쓰던 코드가 환경변수 한 줄로 내 컴퓨터의 모델에 연결됩니다.
  • 같은 질문에 정확도는 laya:en 0.361, kev:9b 0.722로 갈립니다.
  • 에이전트가 실행할 명령을 180밀리초에 차단하는 프리셋이 들어 있습니다.

분류나 판정에 쓰는 AI 호출을 인터넷 너머 API 대신 자기 컴퓨터에서 처리하고 싶다면, 9월 23일 나온 Ollaya가 그 일을 합니다. Ollama가 LLM을 로컬에서 내려받아 돌리듯, Ollaya는 결정 모델(decision model)을 내려받아 돌리는 Apache-2.0 런타임입니다. 개발자 Mert Cobanov가 GitHub 저장소를 만든 지 사흘 만에 릴리스가 여덟 번 나왔습니다. 9월 25일 Hacker News에서는 578점을 받았습니다.

결정 모델은 9월 15일 TypeSafe AI가 Jev를 공개하면서 이름이 붙은 모델 종류입니다. 문장을 쓰지 않습니다. 텍스트와 미리 정해 둔 질문을 받아 고른 답과 확률만 돌려줍니다. "이 문의를 결제팀·기술팀·영업팀 중 어디로 보낼까" 같은 질문에 {"team": "billing"}을 글자 단위로 생성하는 대신, 한 번의 계산으로 선택지별 확률을 냅니다.

코드는 그대로 두고 서버 주소만 바꾼다

Jev를 쓰다가 Ollaya로 옮길 때 고쳐야 할 코드가 없다는 점이 이 프로젝트의 출발점입니다. Ollaya는 POST /v1/systemone, /v1/decisions, GET /v1/models 세 엔드포인트를 TypeSafe와 같은 형식으로 응답합니다. 공식 파이썬 SDK typesafe-sdk 0.7.1은 환경변수 하나만 바꾸면 로컬 서버를 봅니다.

curl -fsSL https://ollaya.dev/install.sh | sh
export TYPESAFE_BASE_URL=http://localhost:11435

바뀌는 것은 요금과 데이터 위치입니다. TypeSafe는 자사 페이지에서 Jev 가격을 입력 10억 토큰당 42달러(100만 토큰당 0.042달러)로 안내하고 출력은 무료로 둡니다. Ollaya는 호출 요금이 0원이고 판정할 텍스트가 기기를 떠나지 않습니다. 대신 모델 가중치를 내려받을 디스크와, 빠르게 돌리려면 GPU가 필요합니다.

Ollaya는 모델 가중치를 다시 배포하지 않습니다. 저장소가 게시하는 것은 약 3MB짜리 ONNX 그래프뿐입니다. 이 그래프가 원저자의 Hugging Face 저장소에 있는 model.safetensors를 커밋 고정과 sha256 검증으로 읽습니다. fp32로 내보낸 결과는 체크포인트당 질문 2,383개에서 PyTorch 참조 구현과 100% 같은 결정을 냈다고 README가 밝힙니다.

Ollaya 공식 모델 페이지의 decider 카드. Qwen3.5 기반 2B와 0.8B 디코더 모델, Apache-2.0 라이선스

정확도는 어느 모델을 고르느냐에 달렸다

옮겨서 잃는 것은 정확도입니다. 얼마나 잃는지는 모델 선택에 달렸습니다. Ollaya는 상태 400개로 만든 자체 벤치마크 "typed decisions"에서 라이브러리의 모델들을 다수결 라벨과 대조했습니다. 기본으로 권하는 가장 빠른 모델과 가장 정확한 모델 사이의 차이가 두 배입니다.

모델typed decisions조건
kev:9b0.72224GB GPU 필요
winnow:e4b0.722Gemma 4 파인튜닝, GGUF
kev:4b0.669
decider:2b0.591기본 decider
nli0.548
gliclass0.477
laya:en0.361기본 추천 모델, 가장 빠름

Ollaya 자신이 이 숫자를 절대값으로 읽지 말라고 적어 뒀습니다. 모델 페이지는 주석자끼리도 라벨이 잘 안 맞는 데이터라 모델 사이 순위 비교로만 쓰라고 밝힙니다. 호스티드 Jev는 이 벤치마크에 올라와 있지 않습니다. TypeSafe가 낸 자사 평가 정확도 67%대는 다른 데이터로 잰 값이라 나란히 놓을 수 없습니다.

그래서 남는 것은 사용자 후기입니다. Hacker News에서 george_max는 "Laya는 Jev보다 눈에 띄게 못하다. 확신이 덜하고 복잡한 질의에서 자주 틀린다"고 적었습니다. 반대쪽 후기도 있습니다. nickstinemates는 Laya를 GTX 970 4GB에서 돌려 기존 Jev API 호출을 대체했습니다. "컨텍스트 창은 매우 작지만 내가 하던 작은 LLM 작업에는 그대로 대체됐다"고 적었습니다.

속도도 하드웨어를 따라갑니다. 릴리스 노트에 실린 실측치는 GPU 유무에 따라 열 배 가까이 벌어집니다.

12.7ms

laya:en, 질문 5개, RTX 4090

114ms

같은 요청, Mac mini M4 Pro GPU

190ms

decider:2b, 질문 5개, RTX 4090

TypeSafe가 자사 페이지에 올린 Jev 예시 작업 시간은 0.114초입니다. RTX 4090에 laya:en을 올리면 그보다 아홉 배 가까이 빠릅니다. 그런데 M4 Pro 맥북에서는 114밀리초로 사실상 같습니다. 정확도를 올리려고 decider:2b를 고르면 4090에서도 190밀리초로 오히려 느려집니다. 로컬로 옮기는 것이 곧 빨라지는 것은 아닙니다.

에이전트가 실행할 명령을 먼저 판정한다

9월 25일 v0.6.0에 들어온 agent 프리셋은 코딩 에이전트를 쓰는 독자에게 가장 직접적인 기능입니다. 에이전트가 실행하려는 명령을 사람이 승인하기 전에 작은 모델이 먼저 훑고 실행·질문·차단 중 하나를 고릅니다. 상태에 사용자의 요청과 명령을 함께 넣으면 네 가지를 답합니다.

요청: "README.md 오타를 고쳐줘"


명령: git push --force origin main

↓

decider:2b, RTX 4090에서 약 180ms

↓
차단 0.53

요청과 무관 0.75 · 파괴적 0.90

같은 요청에 오타를 고치는 sed 명령이 들어오면 실행 0.90으로 통과시킵니다. 공식 문서에 실린 예시 하나라 실제 오탐률은 각자 재봐야 합니다. LLM에게 "이 명령 실행해도 되나"를 물어 문장으로 답을 받던 자리를 확률 네 개로 바꾸는 방식입니다.

같은 날 하루 전 v0.4.0에는 MCP 서버가 들어왔습니다. claude mcp add ollaya -- ollaya mcp 한 줄로 Claude Code·Claude Desktop·Cursor에 연결되고, decide·list_models·show_model·pull_model 네 도구가 열립니다. 에이전트에게 언제 이 도구를 쓸지 알려 주는 스킬(ollaya-decisions)도 함께 배포됩니다. 내장 프리셋은 triage, email, guard, moderation, router, agent 여섯 종입니다.

지금 쓸 수 있나

계정도 신청도 없습니다. 설치하면 그날 씁니다.

항목내용
대상누구나. 가입·승인·대기자 명단 없음
요금

무료. 런타임은 Apache-2.0, 모델은 각자 라이선스(대부분 Apache-2.0, nli:deberta-v3-large는 MIT)

한국 사용

가능. 지역 제한 없음. 판정은 기기 안에서 끝나고, 설치와 가중치 내려받기에만 네트워크가 필요

운영체제

Linux(glibc 2.38 이상, Ubuntu 24.04+), macOS Apple silicon, Windows 10과 11 x64. 데스크톱 앱은 세 운영체제 모두 제공

GPU 조건

NVIDIA는 드라이버 R580 이상(CUDA 13), GPU 팩 약 1.1GB 추가 내려받기. Apple GPU는 macOS 14 이상. kev:9b와 8k 토큰 decider:2b는 24GB GPU

걸리는 데가 둘 있습니다. Windows 설치 파일은 아직 코드 서명이 안 돼 SmartScreen 경고를 넘겨야 하고, NVIDIA 쪽은 CUDA 13 기준으로만 안내돼 구형 드라이버 환경은 지원 여부가 문서에 없습니다. Hacker News에서도 CUDA 12 지원 요청이 올라왔습니다.

프로젝트 자체의 지속 가능성을 묻는 반론도 나왔습니다. emmettbt를 비롯한 여러 명이 Ollama가 결정 모델을 지원하기 시작하면 이 저장소가 설 자리가 없어진다고 지적했고, 이름과 화면 구성이 Ollama를 그대로 따라 한 점도 논란이 됐습니다. 저장소 FAQ는 Ollama와 무관한 독립 프로젝트라고 밝혀 뒀습니다.

이미 Jev나 LLM으로 티켓 분류·요청 라우팅·안전 게이트를 돌리고 있다면, 운영 로그에서 최근 질의 200건을 뽑아 ollaya run decider --format json으로 같은 질문을 던지고 기존 판정과 일치율을 재보는 것이 첫 단계입니다. 일치율이 쓸 만하면 TYPESAFE_BASE_URL 한 줄을 바꾸면 되고, 낮으면 laya 대신 decider나 kev로 올려 다시 재면 됩니다. 아직 결정 모델을 안 쓰고 있다면, 코딩 에이전트에 agent 프리셋을 MCP로 연결해 위험한 명령만 먼저 걸러 보는 쪽이 설치 비용 대비 효과가 빠릅니다.