Minerva
검증을 마친 0.2, 프롬 스크래치 1.0, 그리고 Apollo — 3-트랙으로 진화하는 한국어·코드 특화 LLM
Azwell AI는 한국어·코드 특화 LLM을 3개 트랙으로 동시 개발합니다. 오픈소스 80B MoE 기반 Minerva 0.2로 학습·평가 파이프라인을 검증 완료(벤치마크 실측 공개)했고, 그 자산 위에서 프롬 스크래치(From-Scratch) 파운데이션 모델 Minerva 1.0을 개발 중이며, NVIDIA Nemotron Super 120B에 한국어·코딩 RL을 결합한 플래그십 Apollo를 학습하고 있습니다. 파인튜닝을 넘어 파운데이션 모델까지 — 전 스택을 자체 기술로 내재화합니다.
모델 라인업 — 3개 트랙 동시 개발
Minerva 0.2 — 검증 완료
오픈소스 80B MoE 베이스 + 한국어 CPT·SFT + 자체 하네스(Harness) 추론 — 학습·평가 파이프라인 실측 검증 완료, 벤치마크 결과 공개
Minerva 1.0 — 개발 중
프롬 스크래치(From-Scratch) 사전학습 파운데이션 모델 — 토크나이저·아키텍처·데이터 파이프라인을 백지에서 자체 설계
Apollo — 학습 중
NVIDIA Nemotron Super 120B 베이스 + 한국어 특화 학습 + 코딩 RL 포스트트레이닝 — 최상위 성능을 겨냥한 플래그십
3-트랙은 단계적 기술 내재화 전략입니다. 0.2에서 데이터 정제·학습 인프라·평가 하네스를 실전 검증하고, 검증된 파이프라인 위에서 완전한 통제권을 갖는 프롬 스크래치 1.0을 쌓아 올리며, 동시에 최신 최상위 오픈 베이스(Nemotron Super 120B)에 강화학습을 결합한 Apollo로 당장의 최고 성능을 확보합니다. 리스크는 나누고, 기술 자산은 트랙 간에 공유됩니다.
Minerva 0.2 — 검증된 출발점
학습 + 하네스 결합
한국어 학습에 하네스 추론 기법을 결합해 추가 성능 향상을 실측 검증 — 한국어 종합 지식 기준 +6점 확인
MoE 추론 효율
전체 800억 파라미터 중 추론 시 약 30억만 활성화 — 80억 모델 수준의 속도, 800억 모델의 품질
단일 GPU 운영
INT4 양자화 시 약 45GB — H100/A100 1장으로 추론, 상업 사용 제약 없는 Apache 2.0
Minerva 0.2 벤치마크 결과 — 실측
| 벤치마크 | Minerva v0.2 |
|---|---|
| KMMLU (한국어 지식) | 66 |
| HAE-RAE (한국 문화·상식) | 64 |
| HumanEval (코드) | 85 |
| MBPP (기초 코드) | 78 |
| HumanEval-X-ko ★ (한국어 코드) | 70 |
| KLUE-NLI (한국어 추론) | 89 |
국내 포지셔닝 — Minerva 0.2는 '종합 지식 벤치마크 1위' 경쟁을 좇기보다, 한국어로 코드를 다루는 실무 영역의 정확도와 현실적 운영 비용에 집중한 특화 모델입니다. 코드(HumanEval 85)·한국어 추론(KLUE-NLI 89)에서 강점을 보이며, 단일 GPU(INT4)로 운영 가능한 80B급에 상업 제약 없는 Apache 2.0 오픈 라이선스라는 점에서 — 대형 인프라 없이 한국어 코딩 어시스턴트·RAG를 자체 구축하려는 국내 기업에게 가장 현실적인 대안을 제시합니다. 종합 지식 영역은 프롬 스크래치 1.0과 플래그십 Apollo 트랙에서 보강해 나갑니다.
하네스(Harness) 방법론 — 추가 학습 없이 품질을 끌어올리는 자체 추론 기법
계획
문제를 분석하고 풀이 전략을 먼저 수립
작성
수립한 계획에 따라 초안 응답 생성
비판
모델 스스로 초안의 오류·누락을 점검
수정
비판 결과를 반영해 응답 보완
검증
최종 응답의 일관성·정확성 확인 후 출력
같은 모델에 단계별 사고 흐름을 강제하여 응답 품질을 끌어올리는 기법으로, 모델 추가 학습 없이 코드 약 200줄로 적용됩니다. Minerva 0.2 실측 검증에서 한국어 종합 지식 기준 +6점 향상을 확인 — '한국어 학습 + 하네스'를 결합해 실측까지 마친 한국 최초 사례입니다. 이 평가 하네스는 1.0과 Apollo의 품질 검증에도 그대로 쓰입니다.
Minerva 0.2 — 추론 강점 (Inference Advantages)
MoE 구조의 효율
한 번의 추론에 800억 중 관련 전문가 약 30억 파라미터만 계산(계산량 약 4%) — 일반 800억 모델 대비 압도적으로 빠른 응답
속도 vs 품질 균형
추론 속도는 80억 모델 수준, 학습 용량은 10배(800억) — 속도와 응답 품질 잠재력을 동시에 확보
롱컨텍스트 32K+
코딩 특화 아키텍처(Gated DeltaNet + MoE)로 32K 토큰 이상 처리 — 4K 한계의 일반 대화 모델과 차별화
한국어 × 코딩 결합
한국어 문서를 보고 코드를 짜는 시나리오에 가장 적합 — 다른 한국어 모델 대비 코드 이해·생성 정확도 우위
메모리 요구사항 및 운영 효율
| 구성 | 메모리 사용량 | 1장 GPU 추론 |
|---|---|---|
| 원본 (16-bit) | 160 GB | 불가 (H100 80GB 1장 부족) |
| INT8 양자화 | 약 80 GB | 가능 (H100 1장) |
| INT4 양자화 | 약 45 GB | 가능 (H100/A100 1장) |
양자화 적용 시 성능 손실은 1~2%로 사용자가 인지하기 어려운 수준이며, 표준 도구(AWQ, GPTQ)로 자동 변환됩니다. 클라우드 기준 NVIDIA A100 80GB 1장(시간당 약 $2, 월 약 192만원) 서버 한 대로 Minerva 80B INT4 운영이 가능합니다.
활용 시나리오
B2B 클라우드 API 서비스
최적 — 단일 GPU 서빙으로 현실적 운영 비용
기업 내부 한국어 코딩 어시스턴트
최적 — 한국어 도메인 지식 + 코딩 특화 베이스
한국어 RAG·문서 분석 시스템
적합 — 롱컨텍스트 32K+ 처리
엣지·모바일 임베디드
미지원 — 향후 8억급 디스틸 버전 별도 공개 검토
Minerva 1.0 — 프롬 스크래치(From-Scratch) 파운데이션 (개발 중)
백지에서 자체 설계
토크나이저·모델 아키텍처·학습 레시피를 처음부터 자체 설계 — 오픈소스 파인튜닝을 넘어 파운데이션 모델 구축 기술을 내재화
한국어·코드 중심 데이터 파이프라인
사전학습 코퍼스의 수집·정제·중복 제거·품질 필터링까지 전 과정을 자체 파이프라인으로 구축
0.2 검증 자산 승계
0.2에서 실전 검증한 학습 인프라·평가 하네스를 그대로 적용 — 프롬 스크래치의 리스크를 구조적으로 축소
전 스택 통제권
데이터 출처·라이선스·모델 거동까지 완전한 통제 — 금융·공공 등 규제 산업 커스터마이징의 토대
Apollo — Nemotron Super 120B 기반 플래그십 (학습 중)
최상위급 오픈 베이스
NVIDIA Nemotron Super 120B — 현존 공개 베이스 중 최상위급 추론 성능에서 출발
한국어 특화 학습
한국어 지식·문화·도메인 데이터로 CPT·SFT — 글로벌 베이스의 한국어 공백을 정면으로 보강
코딩 RL 포스트트레이닝
테스트 통과·실행 결과 등 검증 가능한 보상 기반 강화학습(RLVR) — 사람 선호가 아닌 '실제로 도는 코드'로 최적화
왜 Apollo인가
지혜의 여신 Minerva에 이어, 이성·논리·예지의 신 Apollo — 한국어와 코드를 함께 겨냥하는 플래그십의 이름
로드맵 — 검증에서 파운데이션까지
완료 · Minerva 0.2
오픈소스 80B MoE + 한국어 CPT·SFT·DPO + 하네스 — 벤치마크 실측 결과 공개
학습 중 · Apollo
Nemotron Super 120B + 한국어 학습 + 코딩 RL — 플래그십 성능 확보
개발 중 · Minerva 1.0
프롬 스크래치 사전학습 — 완전 자체 파운데이션 모델
확장 · 멀티모달
VLM 베이스 확보 시 비전-언어 확장 검토
학습 파이프라인: CPT(한국어 추가 사전학습) → SFT(도메인 지도학습) → DPO(선호 정렬) → RL(검증 가능 보상 기반 강화학습, Apollo). Minerva 0.2의 벤치마크 실측 결과는 공개되어 있으며, 모델 가중치·코드·평가 결과는 HuggingFace 및 GitHub에 오픈소스로 공개합니다 (라이선스: Apache 2.0).