How to use from
llama.cpp
Install (macOS, Linux)
curl -LsSf https://llama.app/install.sh | sh
# Start a local OpenAI-compatible server with a web UI:
llama serve -hf popiAI/Muse-Glimmer-30B-GGUF:
# Run inference directly in the terminal:
llama cli -hf popiAI/Muse-Glimmer-30B-GGUF:
Install from WinGet (Windows)
winget install llama.cpp
# Start a local OpenAI-compatible server with a web UI:
llama serve -hf popiAI/Muse-Glimmer-30B-GGUF:
# Run inference directly in the terminal:
llama cli -hf popiAI/Muse-Glimmer-30B-GGUF:
Use pre-built binary
# Download pre-built binary from:
# https://github.com/ggerganov/llama.cpp/releases
# Start a local OpenAI-compatible server with a web UI:
./llama-server -hf popiAI/Muse-Glimmer-30B-GGUF:
# Run inference directly in the terminal:
./llama-cli -hf popiAI/Muse-Glimmer-30B-GGUF:
Build from source code
git clone https://github.com/ggerganov/llama.cpp.git
cd llama.cpp
cmake -B build
cmake --build build -j --target llama-server llama-cli
# Start a local OpenAI-compatible server with a web UI:
./build/bin/llama-server -hf popiAI/Muse-Glimmer-30B-GGUF:
# Run inference directly in the terminal:
./build/bin/llama-cli -hf popiAI/Muse-Glimmer-30B-GGUF:
Use Docker
docker model run hf.co/popiAI/Muse-Glimmer-30B-GGUF:
Quick Links

Muse-Glimmer-30B-GGUF

Cuantizaciones GGUF de meta-models/Muse-Glimmer-30B, hechas para servirlas en local con Ollama o llama.cpp. Los pesos y la licencia son del autor original; aquí solo cambia el formato.

Multimodal. La parte visual va en el fichero mmproj-…, aparte de los pesos. Hay que cargarlo explícitamente (ver Uso) o el modelo queda ciego sin decirlo.

Fichero Tamaño sha256
Muse-Glimmer-30B-Q4_K_M.gguf 16.9 GB 2b7e05404f4241ac…
Muse-Glimmer-30B-Q8_0.gguf 29.6 GB ef5eb228b2b9914e…
mmproj-Muse-Glimmer-30B-bf16.gguf 3.8 GB 3e732f1a45f0e494…

Q4_K_M es el equilibrio de siempre; Q8_0 es prácticamente indistinguible del original a cambio del doble de peso. Como referencia de VRAM: en 12 GB entra un 7-8B en Q8_0 o un 14B en Q4_K_M; de ahí para arriba, hay offload a CPU.

Se incluyen los ficheros de licencia del original (LICENSE, USAGE_POLICY.md), como exige su redistribución.

Uso

# llama.cpp — los pesos y el proyector visual se cargan por separado
llama-mtmd-cli -m Muse-Glimmer-30B-Q4_K_M.gguf \
    --mmproj mmproj-Muse-Glimmer-30B-bf16.gguf --image foto.jpg -p "¿Qué ves?"

# solo texto (Ollama)
ollama run hf.co/popiAI/Muse-Glimmer-30B-GGUF:Q4_K_M

Trazabilidad

Modelo base meta-models/Muse-Glimmer-30B
Commit del base a4e59da52a7bc87ae7251dd5545c0dd437c44b68
Intermedio GGUF bf16
llama.cpp release b10353

Generado con el pipeline cuantiza-y-publica del repo ml-lab. Se cuantiza un commit concreto del repo base, no main: repetir esta tabla da los mismos GGUF.

Downloads last month
70
GGUF
Model size
28B params
Architecture
muse-glimmer
Hardware compatibility
Log In to add your hardware

4-bit

8-bit

Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for popiAI/Muse-Glimmer-30B-GGUF

Quantized
(176)
this model