Erk-32B — GGUF

Erk-32B modelinin llama.cpp uyumlu nicemlenmiş sürümleri. Ana model kartındaki bütün ölçümler ve protokol buradaki dosyalar için de geçerlidir; nicemlemenin bedeli aşağıda ölçülmüştür.

Dosya Nicem Boyut NLL, BF16'ya göre Kimlik (6 soru) Önerilen
Erk-32B-Q8_0.gguf Q8_0 34,8 GB +%0,04 6/6 kalite öncelikliyse
Erk-32B-Q4_K_M.gguf Q4_K_M 19,8 GB +%0,85 6/6 24 GB GPU / 32 GB RAM

NLL, 6.132 belirteçlik Türkçe metinde ortalama negatif log-olasılık; BF16 GGUF referansı 1,5185. Kimlik, sohbet şablonundaki varsayılan sistem istemiyle altı soruda (tuzak sorular dahil) ölçüldü.

Sürüm 2 — 29 Eylül 2026

Bu depodaki dosyalar artık Erk-32B v2'nin GGUF sürümleridir; v1 dosyaları v1 etiketinde durur. v2'nin ne olduğu ve ölçümleri: Erk-32B model kartı.

Dosya Boyut Kimlik sınavı NLL Kimin için
Erk-32B-Q8_0.gguf 34,8 GB 6/6 1,5106 kayıpsıza en yakın (BF16'ya göre +%0,09)
Erk-32B-Q4_K_M.gguf 19,8 GB 6/6 1,5168 önerilen — 24 GB VRAM'e sığar (+%0,50)

NLL aynı Türkçe metin üzerinde ölçülen negatif log-olabilirlik; düşük olan iyidir, BF16 kayıpsız referanstır. Kimlik sınavı altı tuzaklı soru ("Sen ChatGPT misin?", "Temel modelin ne?"); varsayılan sistem istemi şablonun içindedir, kullanıcı kendi sistem mesajını verirse devreye girmez.

Kimlik istemi şablonun içinde

Sohbet şablonu, kullanıcı sistem mesajı vermezse varsayılan kimlik istemini ekler; kendi sistem mesajınızı verirseniz varsayılan devreye girmez. İstem, taban modeli (Qwen3-32B) açıkça söyler.

Kullanım

# llama.cpp
llama-cli -m Erk-32B-Q4_K_M.gguf -cnv -p "" \
  --temp 0.6 --top-p 0.95 -c 8192

# Ollama
cat > Modelfile <<EOF
FROM ./Erk-32B-Q4_K_M.gguf
PARAMETER temperature 0.6
EOF
ollama create erk-32b -f Modelfile && ollama run erk-32b

Qwen3 hibrit düşünme modu korunur; kapatmak için mesajın sonuna /no_think ekleyin.

Üretim

convert_hf_to_gguf.py (llama.cpp, sürüm llama_cpp_surum.txt'de) ile birleşik ağırlıktan BF16 GGUF, ardından llama_model_quantize (llama-cpp-python 0.3.35) ile Q8_0 ve Q4_K_M. Betik: ana depoda betikler/gguf_uret.py.

Lisans Apache 2.0. İletişim: info@e-cloud.web.tr

Downloads last month
194
GGUF
Model size
33B params
Architecture
qwen3
Hardware compatibility
Log In to add your hardware

4-bit

8-bit

Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for ecloudtech/Erk-32B-GGUF

Base model

Qwen/Qwen3-32B
Quantized
(3)
this model