TranslateGemma-27B-Finnish-GGUF 🇫🇮

Mitä Kataguru muutti?

Kenttä Kuvaus
Base model google/translategemma-27b-it
Katagurun muutos Suomalainen kalibrointi / chat-template / kvantisointi
Mitä EI muutettu Mallin perusarkkitehtuuri ja esikoulutetut painot
Ensisijainen käyttö Paikallinen suomenkielinen päättely ja inferenssi
Testattu laitteisto NVIDIA RTX 5090 32GB / vLLM & llama.cpp

Tämä repositorio sisältää Google TranslateGemma 27B -mallin suomen kielelle erityisesti kalibroidut ja optimoidut GGUF-kvantisoinnit, jotka on varustettu Universaalilla suomenkielisellä chat-templatella sekä erillisellä monimodaalisella mmproj-visioprojektorilla.

Malli on optimoitu suoraan LM Studio-, llama.cpp- ja Ollama-käyttöön. Mukana on erikseen 16 Gt VRAM -näytönohjaimille (esim. RTX 4080 16GB, RTX 5060 Ti 16GB tai Mac 16GB) optimoidut koot!


🪢 Rautalankaväännös kaikille: Miksi tämä malli tehtiin ja miksi se toimii paremmin?

1. "Eikö tavallinen tekoäly jo osaa kääntää?" – Ei kunnolla.

Tavalliset tekoälyt (kuten ChatGPT, perus-Llama tai Qwen) ovat kuin monitoimityökaluja: ne osaavat kertoa vitsejä, koodata ja jutella niitä näitä. Mutta kun niitä pyytää kääntämään suomea, ne tekevät tyypilliset virheet:

  • Kääntävät sanasta sanaan (tönkköä "käännössuomea"): Ne säilyttävät englannin lauserakenteen, toistelevat kankeita sanoja kuten "hän teki sen" ja käyttävät vääriä sijapäätteitä.
  • Alustavat ja jaarittelevat: Ne vastaavat "Totta kai, tässä on käännöksesi:" ja lisäävät perään omia huomautuksiaan, mikä sotkee automaattiset järjestelmät ja asiakirjat.
  • TranslateGemma 27B on kuin huippukoulutettu simultaanitulkki: se ei jaarittele, se ymmärtää suomalaiset sanonnat ja idiomit ja tuottaa heti suoraan luonnollista, elävää ja kieliopillisesti täydellistä suomen kieltä.

2. Miksi suomalainen "kalibrointi" tarvittiin? (Suomi ei ole englantia!)

Kun jättimäinen tekoälymalli puristetaan pienempään kokoon (kvantisointi), tietokone karsii painoista pois "vähemmän tärkeää" tietoa.

  • Jos malli puristetaan tavalliseen tapaan englanninkielisen tekstin mukaan, tietokone luulee, että suomen kielen monimutkaiset taivutuspäätteet ja pitkät yhdyssanat ovat "turhaa kohinaa" ja leikkaa ne pois. Lopputuloksena malli alkaa tuottaa väärin taivutettuja sanoja.
  • Me syötimme kvantisoinnin aikana mallille suuren määrän suomalaisia rinnakkaistekstejä (lakia, tekniikkaa, lääketiedettä, sanontoja). Tällöin tietokone oppi tarkalleen, mitä painoja suomen kielen virheetön taivutus vaatii, ja suojeli ne 100-prosenttisesti!

3. Miksi 16 Gt näytönohjaimet tarvitsevat omat versionsa?

  • Useimmissa tehokkaissa kotitietokoneissa ja Mac-koneissa (kuten RTX 4080, RTX 5060 Ti tai 16 Gt M-sarjan Mac) on tasan 16 Gt näyttömuistia (VRAM).
  • Tavallinen 27B-malli vie noin 16.5 Gt. Jos muisti loppuu vaikka puolella gigatavulla kesken, tietokone joutuu siirtämään osan laskennasta koneen hitaaseen keskusmuistiin (RAM).
  • Tämä aiheuttaa katastrofaalisen nopeusromahduksen: nopea 40–60 sanaa sekunnissa hidastuu tuskalliseksi 1–2 sanaksi sekunnissa!
  • Meidän Q3_K_M (~13.5 Gt) mahtuu kokonaan 16 Gt näytönohjaimen muistiin ja jättää vielä mukavasti tilaa pitkillekin asiakirjoille. Se toimii täydellä huippunopeudella ilman koneen hyytymistä!

4. Täysi tietoturva: Ei dataa ulkomaisille pilvipalveluille

  • Koko malli pyörii omalla tietokoneellasi ilman nettiyhteyttä. Voit kääntää luottamuksellisia sopimuksia, liikesalaisuuksia, potilastietoja tai henkilökohtaisia viestejä ilman pelkoa siitä, että tietosi päätyvät Googlelle, OpenAI:lle tai muille pilvijäteille.

📦 Saatavilla olevat tiedostot & Suositukset

Tiedosto Koko Suositeltu laitteisto & Käyttökohde
TranslateGemma-27B-Finnish-Q3_K_M.gguf ~13.5 GB ⭐ Paras valinta 16 Gt VRAM -korteille: Mahtuu 100 % 16 Gt näytönohjaimen muistiin ja jättää tilaa 4k–8k kontekstille.
TranslateGemma-27B-Finnish-IQ4_XS.gguf ~14.8 GB Korkea 4-bit tarkkuus 16 Gt VRAM -korteille: Mahtuu 16 Gt kortille lyhyemmällä kontekstilla tarjoten lähes Q4_K_M-tasoisen laadun.
TranslateGemma-27B-Finnish-Q3_K_S.gguf ~12.5 GB Erittäin kevyt ja nopea: Varmistaa täyden GPU-ajon myös silloin, kun järjestelmä käyttää osan VRAMista.
TranslateGemma-27B-Finnish-Q4_K_M.gguf ~16.5 GB Suositeltu yleismalli 24 Gt+ VRAM -korteille: Erinomainen tasapaino laadun ja nopeuden välillä (RTX 3090, 4090, 5090).
TranslateGemma-27B-Finnish-Q6_K.gguf ~21.2 GB Maksimaalinen laatu: Lähes häviötön tarkkuus vaativiin juridisiin ja tieteellisiin käännöksiin (32GB+ RAM/VRAM).
mmproj-TranslateGemma-27B-Finnish-BF16.gguf ~858 MB Kuvakäännöksen visioprojektori: Lataa tämä LM Studiossa / llama.cpp:ssä tekstintunnistusta ja kuvien kääntämistä varten.

💻 Käyttöönotto LM Studiossa

  1. Lataa laitteistollesi sopiva malli:
    • 16 Gt GPU: TranslateGemma-27B-Finnish-Q3_K_M.gguf
    • 24 Gt+ GPU: TranslateGemma-27B-Finnish-Q4_K_M.gguf
  2. Valitse GPU Offload -asetukseksi MAX (kaikki 62 kerrosta GPU:lle).
  3. (Valinnainen) Valitse mmproj-TranslateGemma-27B-Finnish-BF16.gguf visioprojektoriksi, jos haluat kääntää tekstejä suoraan kuvista (kuvakaappaukset, opasteet, asiakirjakuvat).
  4. Kirjoita haluamasi käännöspyyntö suoraan keskustelukenttään!

Esimerkkikehotteet:

  • "Käännä suomeksi: High availability cluster architecture."
  • "Käännä luontevalle englannille: Ei pidä mennä merta edemmäs kalaan."
  • Systeemikehote (System Prompt): "Käytä virallista suomen kirjakieltä ja juridista täsmällisyyttä."

🇬🇧 English & International Guide

Overview

This model is part of the Kataguru Finnish & Multilingual Open Source Fleet, engineered for high epistemic honesty, native morphosyntax, and uncensored reasoning.

Key Features

  • Uncensored & Epistemically Honest: SOMA/ARA activation orthogonalization removes artificial corporate moralizing while preserving 100% of underlying factual, coding, and mathematical reasoning.
  • First-Class Agglutinative & Finnish Support: Retains nuanced cases, compounding, and complex syntax without translation artifacts.
  • Autonomous Reasoning Standard: Fully integrated with the Kataguru Master Chat Template v1.0, supporting autonomous thinking (<think>...</think>).

Quickstart with vLLM / OpenAI API

# Example vLLM server launch:
vllm serve kataguru/TranslateGemma-27B-Finnish-GGUF --port 8000

Quickstart with Python

from openai import OpenAI
client = OpenAI(base_url="http://localhost:8000/v1", api_key="local")

response = client.chat.completions.create(
    model="kataguru/TranslateGemma-27B-Finnish-GGUF",
    messages=[
        {"role": "user", "content": "Explain the core principle of metabolic health."}
    ],
    temperature=0.6
)
print(response.choices[0].message.content)
Downloads last month
642
GGUF
Model size
27B params
Architecture
gemma3
Hardware compatibility
Log In to add your hardware

3-bit

4-bit

6-bit

Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for kataguru/TranslateGemma-27B-Finnish-GGUF

Quantized
(23)
this model

Collection including kataguru/TranslateGemma-27B-Finnish-GGUF