FINAL-Bench/Darwin-28B-NEG

🤗 Hugging Face sourcetext-generationapache-2.026.9B params54 GBsafetensors✓ 13 checksumsupdated today
Submit in one command

Run it next to your model folder. It makes the torrent, checks your files against Hugging Face, and submits it. You just start seeding and paste your key from your account. It only reads your files and never changes them. Read the script first if you like.

curl -fsSL https://pirateface.co/package.sh | bash -s -- --repo FINAL-Bench/Darwin-28B-NEG ./model-folder
Needs a seeder →

⚠️ DEPRECATED — FINAL-Bench/Darwin-28B-Opus 권장

이 모델은 사용을 권장하지 않습니다. 대안: FINAL-Bench/Darwin-28B-Opus 를 사용하세요.


🚨 DEPRECATION NOTICE (2026-04-24)

이 모델은 Darwin V8 NEG(Native Entropy Gating) 기술의 28B 스케일 적용 실험의 산출물입니다. 내부 평가 결과, NEG는 27B 이상 대형 모델에서 성능 향상이 없거나 오히려 역효과를 내는 것으로 확인되어 공식 배포본에서 제외되었습니다.

📊 측정 결과 (GPQA Diamond, 198 문제, Greedy, max_tokens 5010)

모델 정확도 Δ vs Darwin-28B-Opus
Darwin-28B-Opus (권장) 148/198 = 74.75% 기준값
Darwin-28B-NEG (이 모델, 9B-tuned) 147/198 = 74.24% −0.51 pp
Darwin-28B-NEG (logit-shift penalty=2) 14/24 = 58.33% −20.84 pp

🔬 근본 원인

  1. Top-K 게이트는 Greedy 디코딩에서 수학적으로 무효: argmax는 항상 top-k에 포함되므로 top-k 마스킹이 argmax를 바꾸지 못함.
  2. 대형 모델은 이미 잘 캘리브레이션됨: Darwin-28B-Opus는 불확실한 순간에도 top-1이 대부분 정답. NEG의 "불확실할 때 개입" 철학이 오히려 정답을 망침.
  3. Entropy 분포: 28B의 평균 entropy는 0.268로 9B 대비 매우 낮아 NEG 개입 여지 자체가 적음.

✅ 공식 NEG 적용 스케일 규칙

≤ 9B     →  NEG 적용 (검증: Darwin-9B-NEG에서 +15%p 개선)
9B~27B   →  실험적 (추가 검증 필요)
≥ 27B    →  NEG 금지 (28B에서 역효과 검증됨)

📌 권장 사용

Darwin 28B 추론 모델을 찾으신다면 아래를 사용하세요:

9B급 NEG 모델을 찾으신다면:


📝 이 모델은 그대로 두나요?

이 저장소는 연구 기록 및 reproducibility 목적으로 private 상태로 보존됩니다. 기술 보고서 reference_darwin_v8_neg.md에 상세 실패 분석이 기록되어 있습니다.


📝 라이선스

Apache 2.0


Deprecated: 2026-04-24 Maintainer: FINAL-Bench