qwen3.8-27b_euskara—NVFP4
mikelalda/qwen3.8-27b_euskara
modeloaren esportazio kuantizatua NVFP4 + FP8 zehaztasun mistoan, vLLM-rekin
Blackwell GPUetan zerbitzatzeko. 55 GB → 21,8 GiB.
Zehaztasunen banaketa unsloth/Qwen3.8-27B-NVFP4 erreferentziakoaren berdina
da, moduluz modulu.
Modeloari buruzko informazio osoa — entrenamendu-datuak, hiperparametroak, prompt-formatuak eta mugak — oinarrizko modeloaren fitxan dago. Hemen esportazioari dagokiona baino ez.
Egoera: ebaluatu gabe. Ez da benchmarkik exekutatu, ez modelo honekin ez kuantizatu gabekoarekin.
Zehaztasunen banaketa
Ez da NVFP4 uniformea. Hiru zehaztasunen nahasketa da:
| Zehaztasuna | Moduluak | Kop. |
|---|---|---|
NVFP4 w4a4, 16ko taldeak, fp8_e4m3 eskalak |
0–55 geruzetako mlp.{gate,up,down}_proj |
168 |
| FP8 w8 kanalka / a8 tokenka, dinamikoa | self_attn.{q,k,v,o}_proj, linear_attn.{in_proj_qkv,in_proj_z,out_proj}, lm_head, eta 56–63 geruzetako MLPak |
233 |
| FP8 estatikoa tentsoreka | KV cachea (k_scale / v_scale) |
32 |
| bf16 ukitu gabe | ikusmen-dorre osoa, linear_attn.{in_proj_a,in_proj_b,norm}, embed_tokens, layernormak, MTP blokea |
— |
Bi erabaki dira giltzarri:
- MLPen azken 8 geruzak FP8-n gelditzen dira. Kuantizazioarekiko sentikorrenak dira; NVFP4 lauarekiko kalitate-alde ia osoa hor dago, ~400 MB-en truke.
- GatedDeltaNet-en
in_proj_a/in_proj_bez dira ukitzen. Arreta linealaren dimentsio baxuko proiekzioak dira (beta etadturratsa): txikiak, eta kuantizatzeak errekurrentzia desegonkortzen du.
Fitxategiak
| Multzoa | Tentsoreak | Tamaina |
|---|---|---|
| FP8 pisuak | 233 | 9,90 GiB |
| NVFP4 pisu paketatuak | 168 | 6,97 GiB |
bf16 gainerakoa (embed_tokens + normak) |
450 | 2,42 GiB |
Eskalak (weight_scale, *_global_scale, KV) |
769 | 0,88 GiB |
| Ikusmen-dorrea (bf16) | 333 | 0,86 GiB |
| MTP blokea (bf16) | 15 | 0,79 GiB |
| Guztira | 1.968 | 21,8 GiB |
5 shard (model-0000{1..5}-of-00005.safetensors) gehi model_mtp.safetensors.
Xehetasun teknikoak: 64 geruza (16 full_attention, 48 linear_attention),
5120 dimentsio ezkutu, 248.320 tokeneko hiztegia, MTP geruza 1.
Erabilera
Txat-txantiloia (chat_template.jinja) eta prozesadorearen konfigurazioa
checkpointean daude; VL osoa da.
vLLM
vllm serve mikelalda/qwen3.8-27b_euskara-NVFP4 --max-model-len 32768
Baldintzak: vLLM >= 0.27 eta Blackwell (sm_100+) NVFP4 kernel natiboetarako. RTX PRO 6000 (sm_120) balio du.
⚠️ SGLang-en ez da kargatzen.
lm_headFP8-n doa eta ez du onartzen (unsloth-ek bere README-an jartzen duen abisu bera).
Itzulpen-eskaera bat:
from openai import OpenAI
client = OpenAI(base_url="http://localhost:8000/v1", api_key="-")
r = client.chat.completions.create(
model="mikelalda/qwen3.8-27b_euskara-NVFP4",
messages=[
{"role": "system", "content": "Itzultzaile profesionala zara. Eres un traductor profesional."},
{"role": "user", "content": "Itzuli ondorengo testua euskarara / Traduce el siguiente texto al euskera:\nBuenos días a todos."},
],
extra_body={"chat_template_kwargs": {"enable_thinking": False}},
)
print(r.choices[0].message.content)
enable_thinking=False entrenamenduarekin bat dator; ikus oinarrizko
modeloaren fitxa.
Esportazioaren xehetasunak
llm-compressor 0.13.0 bidez sortua, bf16 fusionatutik abiatuta (~10 min),
RTN erabilita.
Kalibrazioa
NVFP4-k eskala global estatikoak ditu (weight_global_scale,
input_global_scale), eta KV cache FP8-k ere bai, beraz datu errealekin
aurrera-pasadak behar dira. Entrenamendu-corpus beraren 256 lagin erabili
dira (txat-txantiloia jada aplikatuta), 2048 tokenera moztuta, ez ingelesezko
corpus generiko bat: domeinutik kanpo kalibratzeak eskala horiek desdoituta
uzten ditu modeloak eu/es-en ikusiko duenerako.
Padding gabe eta batch_size=1: <pad>-ekin betetzeak aktibazioen
estatistikak kutsatuko lituzke.
Egiaztapena
Tentsore-kopuruak erreferentziako indizearekin alderatuta: zazpi multzoak bat
datoz, 1.968 tentsore eta 21,8 GiB. Sortutako quantization_config unsloth-ena
bezalakoa da eremuz eremu (ignore zerrendako 303 modulu berak, target berak),
salbuespen hauekin:
| eremua | unsloth | hemen |
|---|---|---|
version |
0.17.2.a20260716 |
0.18.0 |
group_1.weights.observer |
null |
memoryless_minmax |
group_1.weights.actorder |
"static" |
null |
Azken biak GPTQ-ren sinadura dira: unsloth-ek NVFP4 taldea soilik pasatu zuen GPTQ-tik eta FP8a RTN-n utzi. Hemengo bertsioak RTN erabiltzen du multzo bietan.
Mugak
Oinarrizko modeloaren muga guztiak heredatzen ditu — HiTZ/RAG_eu
benchmarkarekin ebaluatzeko ezintasuna eta epoka bakarra barne. Irakurri
modelo nagusiaren fitxa
erabili aurretik.
Gainera:
- Kuantizazioaren degradazioa, neurtu gabea. NVFP4 w4a4-k bf16-rekiko kalitatea galtzen du; ez da ez perplexitaterik ez benchmarkik exekutatu esportazio honen gainean.
- Kalibrazioa eu/es/en domeinukoa da. Corpus horretatik kanpoko testuetan (kode-sorkuntza, beste hizkuntza batzuk) eskala estatikoak okerrago egongo dira doituta.
- Ikusmen-bidea bf16-n dago baina egiaztatu gabe — oinarrizko modelotik heredatua, ez entrenatua ez neurtua.
- Hardware-menpekotasuna. Blackwell gabe, NVFP4 kernelik ez: emuladutako bideak (halakorik badago) askoz motelagoak dira.
- Downloads last month
- 80