qwen3.8-27b_euskara—NVFP4

mikelalda/qwen3.8-27b_euskara modeloaren esportazio kuantizatua NVFP4 + FP8 zehaztasun mistoan, vLLM-rekin Blackwell GPUetan zerbitzatzeko. 55 GB → 21,8 GiB.

Zehaztasunen banaketa unsloth/Qwen3.8-27B-NVFP4 erreferentziakoaren berdina da, moduluz modulu.

Modeloari buruzko informazio osoa — entrenamendu-datuak, hiperparametroak, prompt-formatuak eta mugak — oinarrizko modeloaren fitxan dago. Hemen esportazioari dagokiona baino ez.

Egoera: ebaluatu gabe. Ez da benchmarkik exekutatu, ez modelo honekin ez kuantizatu gabekoarekin.


Zehaztasunen banaketa

Ez da NVFP4 uniformea. Hiru zehaztasunen nahasketa da:

Zehaztasuna Moduluak Kop.
NVFP4 w4a4, 16ko taldeak, fp8_e4m3 eskalak 0–55 geruzetako mlp.{gate,up,down}_proj 168
FP8 w8 kanalka / a8 tokenka, dinamikoa self_attn.{q,k,v,o}_proj, linear_attn.{in_proj_qkv,in_proj_z,out_proj}, lm_head, eta 56–63 geruzetako MLPak 233
FP8 estatikoa tentsoreka KV cachea (k_scale / v_scale) 32
bf16 ukitu gabe ikusmen-dorre osoa, linear_attn.{in_proj_a,in_proj_b,norm}, embed_tokens, layernormak, MTP blokea —

Bi erabaki dira giltzarri:

  • MLPen azken 8 geruzak FP8-n gelditzen dira. Kuantizazioarekiko sentikorrenak dira; NVFP4 lauarekiko kalitate-alde ia osoa hor dago, ~400 MB-en truke.
  • GatedDeltaNet-en in_proj_a / in_proj_b ez dira ukitzen. Arreta linealaren dimentsio baxuko proiekzioak dira (beta eta dt urratsa): txikiak, eta kuantizatzeak errekurrentzia desegonkortzen du.

Fitxategiak

Multzoa Tentsoreak Tamaina
FP8 pisuak 233 9,90 GiB
NVFP4 pisu paketatuak 168 6,97 GiB
bf16 gainerakoa (embed_tokens + normak) 450 2,42 GiB
Eskalak (weight_scale, *_global_scale, KV) 769 0,88 GiB
Ikusmen-dorrea (bf16) 333 0,86 GiB
MTP blokea (bf16) 15 0,79 GiB
Guztira 1.968 21,8 GiB

5 shard (model-0000{1..5}-of-00005.safetensors) gehi model_mtp.safetensors.

Xehetasun teknikoak: 64 geruza (16 full_attention, 48 linear_attention), 5120 dimentsio ezkutu, 248.320 tokeneko hiztegia, MTP geruza 1.


Erabilera

Txat-txantiloia (chat_template.jinja) eta prozesadorearen konfigurazioa checkpointean daude; VL osoa da.

vLLM

vllm serve mikelalda/qwen3.8-27b_euskara-NVFP4 --max-model-len 32768

Baldintzak: vLLM >= 0.27 eta Blackwell (sm_100+) NVFP4 kernel natiboetarako. RTX PRO 6000 (sm_120) balio du.

⚠️ SGLang-en ez da kargatzen. lm_head FP8-n doa eta ez du onartzen (unsloth-ek bere README-an jartzen duen abisu bera).

Itzulpen-eskaera bat:

from openai import OpenAI

client = OpenAI(base_url="http://localhost:8000/v1", api_key="-")
r = client.chat.completions.create(
    model="mikelalda/qwen3.8-27b_euskara-NVFP4",
    messages=[
        {"role": "system", "content": "Itzultzaile profesionala zara. Eres un traductor profesional."},
        {"role": "user", "content": "Itzuli ondorengo testua euskarara / Traduce el siguiente texto al euskera:\nBuenos días a todos."},
    ],
    extra_body={"chat_template_kwargs": {"enable_thinking": False}},
)
print(r.choices[0].message.content)

enable_thinking=False entrenamenduarekin bat dator; ikus oinarrizko modeloaren fitxa.


Esportazioaren xehetasunak

llm-compressor 0.13.0 bidez sortua, bf16 fusionatutik abiatuta (~10 min), RTN erabilita.

Kalibrazioa

NVFP4-k eskala global estatikoak ditu (weight_global_scale, input_global_scale), eta KV cache FP8-k ere bai, beraz datu errealekin aurrera-pasadak behar dira. Entrenamendu-corpus beraren 256 lagin erabili dira (txat-txantiloia jada aplikatuta), 2048 tokenera moztuta, ez ingelesezko corpus generiko bat: domeinutik kanpo kalibratzeak eskala horiek desdoituta uzten ditu modeloak eu/es-en ikusiko duenerako.

Padding gabe eta batch_size=1: <pad>-ekin betetzeak aktibazioen estatistikak kutsatuko lituzke.

Egiaztapena

Tentsore-kopuruak erreferentziako indizearekin alderatuta: zazpi multzoak bat datoz, 1.968 tentsore eta 21,8 GiB. Sortutako quantization_config unsloth-ena bezalakoa da eremuz eremu (ignore zerrendako 303 modulu berak, target berak), salbuespen hauekin:

eremua unsloth hemen
version 0.17.2.a20260716 0.18.0
group_1.weights.observer null memoryless_minmax
group_1.weights.actorder "static" null

Azken biak GPTQ-ren sinadura dira: unsloth-ek NVFP4 taldea soilik pasatu zuen GPTQ-tik eta FP8a RTN-n utzi. Hemengo bertsioak RTN erabiltzen du multzo bietan.


Mugak

Oinarrizko modeloaren muga guztiak heredatzen ditu — HiTZ/RAG_eu benchmarkarekin ebaluatzeko ezintasuna eta epoka bakarra barne. Irakurri modelo nagusiaren fitxa erabili aurretik.

Gainera:

  • Kuantizazioaren degradazioa, neurtu gabea. NVFP4 w4a4-k bf16-rekiko kalitatea galtzen du; ez da ez perplexitaterik ez benchmarkik exekutatu esportazio honen gainean.
  • Kalibrazioa eu/es/en domeinukoa da. Corpus horretatik kanpoko testuetan (kode-sorkuntza, beste hizkuntza batzuk) eskala estatikoak okerrago egongo dira doituta.
  • Ikusmen-bidea bf16-n dago baina egiaztatu gabe — oinarrizko modelotik heredatua, ez entrenatua ez neurtua.
  • Hardware-menpekotasuna. Blackwell gabe, NVFP4 kernelik ez: emuladutako bideak (halakorik badago) askoz motelagoak dira.
Downloads last month
80
Safetensors
Model size
20B params
Tensor type
BF16
·
F8_E4M3
·
U8
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for mikelalda/qwen3.8-27b_euskara-NVFP4

Base model

Qwen/Qwen3.8-27B
Quantized
(2)
this model

Datasets used to train mikelalda/qwen3.8-27b_euskara-NVFP4