Instructions to use kataguru/TranslateGemma-27B-Finnish-GGUF with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- llama.cpp
How to use kataguru/TranslateGemma-27B-Finnish-GGUF with llama.cpp:
Install (macOS, Linux)
curl -LsSf https://llama.app/install.sh | sh # Start a local OpenAI-compatible server with a web UI: llama serve -hf kataguru/TranslateGemma-27B-Finnish-GGUF:Q4_K_M # Run inference directly in the terminal: llama cli -hf kataguru/TranslateGemma-27B-Finnish-GGUF:Q4_K_M
Install from WinGet (Windows)
winget install llama.cpp # Start a local OpenAI-compatible server with a web UI: llama serve -hf kataguru/TranslateGemma-27B-Finnish-GGUF:Q4_K_M # Run inference directly in the terminal: llama cli -hf kataguru/TranslateGemma-27B-Finnish-GGUF:Q4_K_M
Use pre-built binary
# Download pre-built binary from: # https://github.com/ggerganov/llama.cpp/releases # Start a local OpenAI-compatible server with a web UI: ./llama-server -hf kataguru/TranslateGemma-27B-Finnish-GGUF:Q4_K_M # Run inference directly in the terminal: ./llama-cli -hf kataguru/TranslateGemma-27B-Finnish-GGUF:Q4_K_M
Build from source code
git clone https://github.com/ggerganov/llama.cpp.git cd llama.cpp cmake -B build cmake --build build -j --target llama-server llama-cli # Start a local OpenAI-compatible server with a web UI: ./build/bin/llama-server -hf kataguru/TranslateGemma-27B-Finnish-GGUF:Q4_K_M # Run inference directly in the terminal: ./build/bin/llama-cli -hf kataguru/TranslateGemma-27B-Finnish-GGUF:Q4_K_M
Use Docker
docker model run hf.co/kataguru/TranslateGemma-27B-Finnish-GGUF:Q4_K_M
- LM Studio
- Jan
- vLLM
How to use kataguru/TranslateGemma-27B-Finnish-GGUF with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "kataguru/TranslateGemma-27B-Finnish-GGUF" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "kataguru/TranslateGemma-27B-Finnish-GGUF", "messages": [ { "role": "user", "content": [ { "type": "text", "text": "Describe this image in one sentence." }, { "type": "image_url", "image_url": { "url": "https://cdn.britannica.com/61/93061-050-99147DCE/Statue-of-Liberty-Island-New-York-Bay.jpg" } } ] } ] }'Use Docker
docker model run hf.co/kataguru/TranslateGemma-27B-Finnish-GGUF:Q4_K_M
- Ollama
How to use kataguru/TranslateGemma-27B-Finnish-GGUF with Ollama:
ollama run hf.co/kataguru/TranslateGemma-27B-Finnish-GGUF:Q4_K_M
- Unsloth Desktop
- Docker Model Runner
How to use kataguru/TranslateGemma-27B-Finnish-GGUF with Docker Model Runner:
docker model run hf.co/kataguru/TranslateGemma-27B-Finnish-GGUF:Q4_K_M
- Lemonade
How to use kataguru/TranslateGemma-27B-Finnish-GGUF with Lemonade:
Pull the model
# Download Lemonade from https://lemonade-server.ai/ lemonade pull kataguru/TranslateGemma-27B-Finnish-GGUF:Q4_K_M
Run and chat with the model
lemonade run user.TranslateGemma-27B-Finnish-GGUF-Q4_K_M
List all available models
lemonade list
- Atomic Chat
TranslateGemma-27B-Finnish-GGUF 🇫🇮
🌐 Quick Navigation / Valitse Kieli
🇫🇮 Suomenkielinen mallikortti & käyttöohje | 🇬🇧 English Documentation & Quickstart
Mitä Kataguru muutti?
| Kenttä | Kuvaus |
|---|---|
| Base model | google/translategemma-27b-it |
| Katagurun muutos | Suomalainen kalibrointi / chat-template / kvantisointi |
| Mitä EI muutettu | Mallin perusarkkitehtuuri ja esikoulutetut painot |
| Ensisijainen käyttö | Paikallinen suomenkielinen päättely ja inferenssi |
| Testattu laitteisto | NVIDIA RTX 5090 32GB / vLLM & llama.cpp |
Tämä repositorio sisältää Google TranslateGemma 27B -mallin suomen kielelle erityisesti kalibroidut ja optimoidut GGUF-kvantisoinnit, jotka on varustettu Universaalilla suomenkielisellä chat-templatella sekä erillisellä monimodaalisella mmproj-visioprojektorilla.
Malli on optimoitu suoraan LM Studio-, llama.cpp- ja Ollama-käyttöön. Mukana on erikseen 16 Gt VRAM -näytönohjaimille (esim. RTX 4080 16GB, RTX 5060 Ti 16GB tai Mac 16GB) optimoidut koot!
🪢 Rautalankaväännös kaikille: Miksi tämä malli tehtiin ja miksi se toimii paremmin?
1. "Eikö tavallinen tekoäly jo osaa kääntää?" – Ei kunnolla.
Tavalliset tekoälyt (kuten ChatGPT, perus-Llama tai Qwen) ovat kuin monitoimityökaluja: ne osaavat kertoa vitsejä, koodata ja jutella niitä näitä. Mutta kun niitä pyytää kääntämään suomea, ne tekevät tyypilliset virheet:
- Kääntävät sanasta sanaan (tönkköä "käännössuomea"): Ne säilyttävät englannin lauserakenteen, toistelevat kankeita sanoja kuten "hän teki sen" ja käyttävät vääriä sijapäätteitä.
- Alustavat ja jaarittelevat: Ne vastaavat "Totta kai, tässä on käännöksesi:" ja lisäävät perään omia huomautuksiaan, mikä sotkee automaattiset järjestelmät ja asiakirjat.
- TranslateGemma 27B on kuin huippukoulutettu simultaanitulkki: se ei jaarittele, se ymmärtää suomalaiset sanonnat ja idiomit ja tuottaa heti suoraan luonnollista, elävää ja kieliopillisesti täydellistä suomen kieltä.
2. Miksi suomalainen "kalibrointi" tarvittiin? (Suomi ei ole englantia!)
Kun jättimäinen tekoälymalli puristetaan pienempään kokoon (kvantisointi), tietokone karsii painoista pois "vähemmän tärkeää" tietoa.
- Jos malli puristetaan tavalliseen tapaan englanninkielisen tekstin mukaan, tietokone luulee, että suomen kielen monimutkaiset taivutuspäätteet ja pitkät yhdyssanat ovat "turhaa kohinaa" ja leikkaa ne pois. Lopputuloksena malli alkaa tuottaa väärin taivutettuja sanoja.
- Me syötimme kvantisoinnin aikana mallille suuren määrän suomalaisia rinnakkaistekstejä (lakia, tekniikkaa, lääketiedettä, sanontoja). Tällöin tietokone oppi tarkalleen, mitä painoja suomen kielen virheetön taivutus vaatii, ja suojeli ne 100-prosenttisesti!
3. Miksi 16 Gt näytönohjaimet tarvitsevat omat versionsa?
- Useimmissa tehokkaissa kotitietokoneissa ja Mac-koneissa (kuten RTX 4080, RTX 5060 Ti tai 16 Gt M-sarjan Mac) on tasan 16 Gt näyttömuistia (VRAM).
- Tavallinen 27B-malli vie noin 16.5 Gt. Jos muisti loppuu vaikka puolella gigatavulla kesken, tietokone joutuu siirtämään osan laskennasta koneen hitaaseen keskusmuistiin (RAM).
- Tämä aiheuttaa katastrofaalisen nopeusromahduksen: nopea 40–60 sanaa sekunnissa hidastuu tuskalliseksi 1–2 sanaksi sekunnissa!
- Meidän
Q3_K_M(~13.5 Gt) mahtuu kokonaan 16 Gt näytönohjaimen muistiin ja jättää vielä mukavasti tilaa pitkillekin asiakirjoille. Se toimii täydellä huippunopeudella ilman koneen hyytymistä!
4. Täysi tietoturva: Ei dataa ulkomaisille pilvipalveluille
- Koko malli pyörii omalla tietokoneellasi ilman nettiyhteyttä. Voit kääntää luottamuksellisia sopimuksia, liikesalaisuuksia, potilastietoja tai henkilökohtaisia viestejä ilman pelkoa siitä, että tietosi päätyvät Googlelle, OpenAI:lle tai muille pilvijäteille.
📦 Saatavilla olevat tiedostot & Suositukset
| Tiedosto | Koko | Suositeltu laitteisto & Käyttökohde |
|---|---|---|
TranslateGemma-27B-Finnish-Q3_K_M.gguf |
~13.5 GB | ⭐ Paras valinta 16 Gt VRAM -korteille: Mahtuu 100 % 16 Gt näytönohjaimen muistiin ja jättää tilaa 4k–8k kontekstille. |
TranslateGemma-27B-Finnish-IQ4_XS.gguf |
~14.8 GB | Korkea 4-bit tarkkuus 16 Gt VRAM -korteille: Mahtuu 16 Gt kortille lyhyemmällä kontekstilla tarjoten lähes Q4_K_M-tasoisen laadun. |
TranslateGemma-27B-Finnish-Q3_K_S.gguf |
~12.5 GB | Erittäin kevyt ja nopea: Varmistaa täyden GPU-ajon myös silloin, kun järjestelmä käyttää osan VRAMista. |
TranslateGemma-27B-Finnish-Q4_K_M.gguf |
~16.5 GB | Suositeltu yleismalli 24 Gt+ VRAM -korteille: Erinomainen tasapaino laadun ja nopeuden välillä (RTX 3090, 4090, 5090). |
TranslateGemma-27B-Finnish-Q6_K.gguf |
~21.2 GB | Maksimaalinen laatu: Lähes häviötön tarkkuus vaativiin juridisiin ja tieteellisiin käännöksiin (32GB+ RAM/VRAM). |
mmproj-TranslateGemma-27B-Finnish-BF16.gguf |
~858 MB | Kuvakäännöksen visioprojektori: Lataa tämä LM Studiossa / llama.cpp:ssä tekstintunnistusta ja kuvien kääntämistä varten. |
💻 Käyttöönotto LM Studiossa
- Lataa laitteistollesi sopiva malli:
- 16 Gt GPU:
TranslateGemma-27B-Finnish-Q3_K_M.gguf - 24 Gt+ GPU:
TranslateGemma-27B-Finnish-Q4_K_M.gguf
- 16 Gt GPU:
- Valitse GPU Offload -asetukseksi MAX (kaikki 62 kerrosta GPU:lle).
- (Valinnainen) Valitse
mmproj-TranslateGemma-27B-Finnish-BF16.ggufvisioprojektoriksi, jos haluat kääntää tekstejä suoraan kuvista (kuvakaappaukset, opasteet, asiakirjakuvat). - Kirjoita haluamasi käännöspyyntö suoraan keskustelukenttään!
Esimerkkikehotteet:
- "Käännä suomeksi: High availability cluster architecture."
- "Käännä luontevalle englannille: Ei pidä mennä merta edemmäs kalaan."
- Systeemikehote (System Prompt): "Käytä virallista suomen kirjakieltä ja juridista täsmällisyyttä."
🇬🇧 English & International Guide
Overview
This model is part of the Kataguru Finnish & Multilingual Open Source Fleet, engineered for high epistemic honesty, native morphosyntax, and uncensored reasoning.
Key Features
- Uncensored & Epistemically Honest: SOMA/ARA activation orthogonalization removes artificial corporate moralizing while preserving 100% of underlying factual, coding, and mathematical reasoning.
- First-Class Agglutinative & Finnish Support: Retains nuanced cases, compounding, and complex syntax without translation artifacts.
- Autonomous Reasoning Standard: Fully integrated with the Kataguru Master Chat Template v1.0, supporting autonomous thinking (
<think>...</think>).
Quickstart with vLLM / OpenAI API
# Example vLLM server launch:
vllm serve kataguru/TranslateGemma-27B-Finnish-GGUF --port 8000
Quickstart with Python
from openai import OpenAI
client = OpenAI(base_url="http://localhost:8000/v1", api_key="local")
response = client.chat.completions.create(
model="kataguru/TranslateGemma-27B-Finnish-GGUF",
messages=[
{"role": "user", "content": "Explain the core principle of metabolic health."}
],
temperature=0.6
)
print(response.choices[0].message.content)
- Downloads last month
- 642
3-bit
4-bit
6-bit
Model tree for kataguru/TranslateGemma-27B-Finnish-GGUF
Base model
google/translategemma-27b-it