Ollama Models

Inhalte

KI-Modelle für Olama

Alle Modelle in diesem Verzeichnis liegen im GGUF-Format vor und können daher direkt in Ollama ausgeführt werden. Hier finden Sie den vollständigen Katalog mit den zum Kopieren bereitstehenden Befehlen.

Mistral-Small-24B-Instruct-2501-GGUF

MaziyarPanahi24 Mrd24 GB RAM

24B Open-Weight-Modell von MaziyarPanahi für lokale KI-Inferenz.

ollama pull mistral-small-24b-instruct-2501:24b

Llama-3-8B-Instruct-32k-v0.1-GGUF

MaziyarPanahi8B16 GB RAM

8B Open-Weight-Modell von MaziyarPanahi für lokale KI-Inferenz.

ollama pull llama-3-8b-instruct-32k-v0.1:8b

SmolLM2-135M-GGUF

QuantFactoryUnbekannt8 GB RAM

Unbekanntes Open-Weight-Modell von QuantFactory für lokale KI-Inferenz.

ollama pull smollm2-135m:latest

Qwen3.6-35B-A3B-NVFP4-MTP-GGUF

michaelw999935 Mrd48 GB RAM

35B Open-Weight-Modell von michaelw9999 für lokale KI-Inferenz.

ollama pull qwen3.6-35b-a3b-nvfp4-mtp:35b

Lama-3.3-70B-Anweisung-GGUF

MaziyarPanahi70 Mrd48 GB RAM

70B Open-Weight-Modell von MaziyarPanahi für lokale KI-Inferenz.

ollama pull llama-3.3-70b:70b

gemma-3-4b-it-GGUF

MaziyarPanahi4B8 GB RAM

4B Open-Weight-Modell von MaziyarPanahi für lokale KI-Inferenz.

ollama pull gemma-3-4b-it:4b

Mistral-7B-Instruct-v0.3-GGUF

MaziyarPanahi7B8 GB RAM

7B Open-Weight-Modell von MaziyarPanahi für lokale KI-Inferenz.

ollama pull mistral-7b-instruct-v0.3:7b

Mixtral-8x22B-v0.1-GGUF

MaziyarPanahi22 Mrd24 GB RAM

22B Open-Weight-Modell von MaziyarPanahi für lokale KI-Inferenz.

ollama pull mixtral-8x22b-v0.1:22b

Qwen3.8_4B_Distilled_GGUF

Ma7ee74B8 GB RAM

4B Open-Weight-Modell von Ma7ee7 für lokale KI-Inferenz.

ollama pull qwen3.8-4b-distilled-gguf:4b

Meta-Llama-3-8B-Instruct-GGUF

MaziyarPanahi8B16 GB RAM

8B Open-Weight-Modell von MaziyarPanahi für lokale KI-Inferenz.

ollama pull meta-llama-3-8b:8b

Melody1437-26B-A4B-v2.0-GGUF

ReadyArt26 Mrd24 GB RAM

26B Open-Weight-Modell von ReadyArt für lokale KI-Inferenz.

ollama pull melody1437-26b-a4b-v2.0:26b

Serenity-26B-A4B-GGUF

ReadyArt26 Mrd24 GB RAM

26B Open-Weight-Modell von ReadyArt für lokale KI-Inferenz.

ollama pull serenity-26b-a4b:26b

Dark-Scarlett-v0.3-26B-A4B-GGUF

ReadyArt26 Mrd24 GB RAM

26B Open-Weight-Modell von ReadyArt für lokale KI-Inferenz.

ollama pull dark-scarlett-v0.3-26b-a4b:26b

XYZAILab_XYZ-Aquila-mini-GGUF

BartowskiUnbekannt8 GB RAM

Unbekanntes Open-Weight-Modell von Bartowski für lokale KI-Inferenz.

ollama pull xyzailab-xyz-aquila-mini:latest

Qwen3.5-4B-Claude-4.6-Opus-Reasoning-Distilled-GGUF

Jackrong4B8 GB RAM

4B Open-Weight-Modell von Jackrong für lokale KI-Inferenz.

ollama pull qwen3.5-4b-claude-4.6-opus-reasoning-distilled:4b

Parabel-Granit-4.1-8B-Claude-Fabel-5-GGUF

AnkitAI8B16 GB RAM

8B Open-Weight-Modell von AnkitAI für lokale KI-Inferenz.

ollama pull parable-granite-4.1-8b-claude-fable-5:8b

Qwen3.6-14B-A3B-FableVibes-GGUF

tvall4314 Mrd24 GB RAM

14B Open-Weight-Modell von tvall43 für lokale KI-Inferenz.

ollama pull qwen3.6-14b-a3b-fablevibes:14b

MiniMax-H3-Pruned-GGUF

AbirayUnbekannt8 GB RAM

Unbekanntes Open-Weight-Modell von Abiray für lokale KI-Inferenz.

ollama pull minimax-h3-pruned:latest

Qwen_Qwen3.5-0.8B-GGUF

Alibaba0.8 Mrd2 GB RAM

0.8B Open-Weight-Modell von Alibaba für lokale KI-Inferenz.

ollama pull qwen-qwen3.5-0.8b:0.8b

Qwen3.6-35B-A3B-APEX-GGUF

Mudler35 Mrd48 GB RAM

35B Open-Weight-Modell von Mudler für lokale KI-Inferenz.

ollama pull qwen3.6-35b-a3b-apex:35b

supergemma4-26b-uncensored-gguf-v2

Jiunsong26 Mrd24 GB RAM

26B Open-Weight-Modell von Jiunsong für lokale KI-Inferenz.

ollama pull supergemma4-26b-uncensored-gguf-v2:26b

gemma-4-26B-A4B-it-APEX-GGUF

Mudler26 Mrd24 GB RAM

26B Open-Weight-Modell von Mudler für lokale KI-Inferenz.

ollama pull gemma-4-26b-a4b-it-apex:26b

Qwopus3.6-27B-Coder-MTP-GGUF

Jackrong27 Mrd24 GB RAM

27B Open-Weight-Modell von Jackrong für lokale KI-Inferenz.

ollama pull qwopus3.6-27b-coder-mtp:27b

Qwen_Qwen3.5-2B-GGUF

Alibaba2B4 GB RAM

2B Open-Weight-Modell von Alibaba für lokale KI-Inferenz.

ollama pull qwen-qwen3.5-2b:2b

Qwen3.5-397B-A17B-GGUF

Alibaba397 Mrd80 GB RAM

397B Open-Weight-Modell von Alibaba für lokale KI-Inferenz.

ollama pull qwen3.5-397b-a17b:397b

Qwen3-4B-Instruct-2507-GGUF

MaziyarPanahi4B8 GB RAM

4B Open-Weight-Modell von MaziyarPanahi für lokale KI-Inferenz.

ollama pull qwen3-4b-instruct-2507:4b

Ternary-Bonsai-8B-gguf

Prisma-ml8B16 GB RAM

8B Open-Weight-Modell von prism-ml für lokale KI-Inferenz.

ollama pull ternary-bonsai-8b:8b

PinkCherry_NSFW_LTX23

SexGod1979Unbekannt8 GB RAM

Unbekanntes Open-Weight-Modell von SexGod1979 für lokale KI-Inferenz.

ollama pull pinkcherry-nsfw-ltx23:latest

Parabel-Granit-4.1-3B-Claude-Fabel-5-GGUF

AnkitAI3B4 GB RAM

3B Open-Weight-Modell von AnkitAI für lokale KI-Inferenz.

ollama pull parable-granite-4.1-3b-claude-fable-5:3b

Qwen_Qwen3.5-35B-A3B-GGUF

Alibaba35 Mrd48 GB RAM

35B Open-Weight-Modell von Alibaba für lokale KI-Inferenz.

ollama pull qwen-qwen3.5-35b-a3b:35b

endless-frontier_BigBang-v1-GGUF

BartowskiUnbekannt8 GB RAM

Unbekanntes Open-Weight-Modell von Bartowski für lokale KI-Inferenz.

ollama pull endless-frontier-bigbang-v1:latest

Qwen_Qwen3.5-4B-GGUF

Alibaba4B8 GB RAM

4B Open-Weight-Modell von Alibaba für lokale KI-Inferenz.

ollama pull qwen-qwen3.5-4b:4b

Qwen3.6-27B-Heretic-Uncensored-FINETUNE-NEO-CODE-Di-IMatrix-MAX-GGUF

DavidAU27 Mrd24 GB RAM

27B Open-Weight-Modell von DavidAU für lokale KI-Inferenz.

ollama pull qwen3.6-27b-heretic-uncensored-finetune-neo-code-di-imatrix-max:27b

Qwen3.5-9B-DeepSeek-V4-Flash-GGUF

Jackrong9B16 GB RAM

9B Open-Weight-Modell von Jackrong für lokale KI-Inferenz.

ollama pull qwen3.5-9b-deepseek-v4-flash:9b

Parabel-Qwen3-8B-Claude-Fabel-5-GGUF

AnkitAI8B16 GB RAM

8B Open-Weight-Modell von AnkitAI für lokale KI-Inferenz.

ollama pull parable-qwen3-8b-claude-fable-5:8b

grug-27b-gguf

ProCreations27 Mrd24 GB RAM

27B Open-Weight-Modell von ProCreations für lokale KI-Inferenz.

ollama pull grug-27b:27b

GLM-4.7-Flash-GGUF

UnträgheitUnbekannt8 GB RAM

Unbekanntes Open-Weight-Modell von Unsloth für lokale KI-Inferenz.

ollama pull glm-4.7-flash:latest

gemma-4-31B-it-qat-q4_0-gguf

Google31 Mrd24 GB RAM

31B Open-Weight-Modell von Google für lokale KI-Inferenz.

ollama pull gemma-4-31b-it-qat-q4-0:31b

Qwen3.5-27B-GGUF

Alibaba27 Mrd24 GB RAM

27B Open-Weight-Modell von Alibaba für lokale KI-Inferenz.

ollama pull qwen3.5-27b:27b

Kwaipilot_KAT-Coder-V2.5-Dev-GGUF

BartowskiUnbekannt8 GB RAM

Unbekanntes Open-Weight-Modell von Bartowski für lokale KI-Inferenz.

ollama pull kwaipilot-kat-coder-v2.5-dev:latest

Parabel-Qwen3-4B-Claude-Fabel-5-GGUF

AnkitAI4B8 GB RAM

4B Open-Weight-Modell von AnkitAI für lokale KI-Inferenz.

ollama pull parable-qwen3-4b-claude-fable-5:4b

gemma-4-E2B-it-qat-GGUF

Google2B4 GB RAM

2B Open-Weight-Modell von Google für lokale KI-Inferenz.

ollama pull gemma-4-e2b-it-qat:2b

ACE-Schritt-1.5-GGUF

ServeurpersoUnbekannt8 GB RAM

Unbekanntes Open-Weight-Modell von Serveurperso für lokale KI-Inferenz.

ollama pull ace-step-1.5:latest

Huihui-DeepSeek-V4-Flash-0731-abliterated-GGUF

huihui-aiUnbekannt8 GB RAM

Unbekanntes Open-Weight-Modell von huihui-ai für lokale KI-Inferenz.

ollama pull huihui-deepseek-v4-flash-0731-abliterated:latest

POCKET-35B-GGUF

ENDGÜLTIGE - Bank35 Mrd48 GB RAM

35B Open-Weight-Modell von FINAL-Bench für lokale KI-Inferenz.

ollama pull pocket-35b:35b

gemma-4-26B-A4B-it-qat-q4_0-gguf

Google26 Mrd24 GB RAM

26B Open-Weight-Modell von Google für lokale KI-Inferenz.

ollama pull gemma-4-26b-a4b-it-qat-q4-0:26b

gemma-4-E2B-it-qat-q4_0-gguf

Google2B4 GB RAM

2B Open-Weight-Modell von Google für lokale KI-Inferenz.

ollama pull gemma-4-e2b-it-qat-q4-0:2b

gemma-4-E4B-it-qat-q4_0-gguf

Google4B8 GB RAM

4B Open-Weight-Modell von Google für lokale KI-Inferenz.

ollama pull gemma-4-e4b-it-qat-q4-0:4b

Automobilindustrie

Schwungrad-KIUnbekannt8 GB RAM

Unbekanntes Open-Weight-Modell von flywheel-ai für lokale KI-Inferenz.

ollama pull automotive:latest

DeepSeek-V4-Flash-0731-GGUF

DeepSeekUnbekannt8 GB RAM

Unbekanntes Open-Weight-Modell von DeepSeek für lokale KI-Inferenz.

ollama pull deepseek-v4-flash-0731:latest

LFM2.5-2.6B-GGUF

LiquidAI2.6 Mrd4 GB RAM

2.6 Milliarden Open-Weight-Modell von LiquidAI für lokale KI-Inferenz.

ollama pull lfm2.5-2.6b:2.6b

Qwen3.5-122B-A10B-GGUF

Alibaba122 Mrd80 GB RAM

122B Open-Weight-Modell von Alibaba für lokale KI-Inferenz.

ollama pull qwen3.5-122b-a10b:122b

Qwen3.8-27B-Unzensiert-GGUF

Jonathan Coletti27 Mrd24 GB RAM

27B Open-Weight-Modell von JonathanColetti für lokale KI-Inferenz.

ollama pull qwen3.8-27b-uncensored:27b

MiniMax-H3

DeepBeepMeepUnbekannt8 GB RAM

Unbekanntes Open-Weight-Modell von DeepBeepMeep für lokale KI-Inferenz.

ollama pull minimax-h3:latest

MiniMax-H3_GGUFs

realrebelaiUnbekannt8 GB RAM

Unbekanntes Open-Weight-Modell von realrebelai für lokale KI-Inferenz.

ollama pull minimax-h3-ggufs:latest

audio.cpp-gguf

audio-cppUnbekannt8 GB RAM

Unbekanntes Open-Weight-Modell von audio-cpp für lokale KI-Inferenz.

ollama pull audio.cpp:latest

Inkling-Small-GGUF

UnträgheitUnbekannt8 GB RAM

Unbekanntes Open-Weight-Modell von Unsloth für lokale KI-Inferenz.

ollama pull inkling-small:latest

Maple-Vorschau-GGUF

DeepgroveUnbekannt8 GB RAM

Unbekanntes Open-Weight-Modell von Deepgrove für lokale KI-Inferenz.

ollama pull maple-preview:latest

KAT-Coder-V2.5-Dev-APEX-GGUF

MudlerUnbekannt8 GB RAM

Unbekanntes Open-Weight-Modell von Mudler für lokale KI-Inferenz.

ollama pull kat-coder-v2.5-dev-apex:latest

Qwen3-TTS-GGUF

ServeurpersoUnbekannt8 GB RAM

Unbekanntes Open-Weight-Modell von Serveurperso für lokale KI-Inferenz.

ollama pull qwen3-tts:latest

MiniMax-H3-GGUF

AbirayUnbekannt8 GB RAM

Unbekanntes Open-Weight-Modell von Abiray für lokale KI-Inferenz.

ollama pull minimax-h3:latest

Muse-Glimmer-30B-GGUF

Unträgheit30 Mrd24 GB RAM

30B Open-Weight-Modell von Unsloth für lokale KI-Inferenz.

ollama pull muse-glimmer-30b:30b

Laguna-XS-2.1-APEX-GGUF

MudlerUnbekannt8 GB RAM

Unbekanntes Open-Weight-Modell von Mudler für lokale KI-Inferenz.

ollama pull laguna-xs-2.1-apex:latest

Qwen3-30B-A3B-Thinking-2507-GGUF

Alibaba30 Mrd24 GB RAM

30B Open-Weight-Modell von Alibaba für lokale KI-Inferenz.

ollama pull qwen3-30b-a3b-thinking-2507:30b

Qwen3.8-27B-GGUF

Alibaba27 Mrd24 GB RAM

27B Open-Weight-Modell von Alibaba für lokale KI-Inferenz.

ollama pull qwen3.8-27b:27b

Higgs Audio v3 Studio

drbaphUnbekannt8 GB RAM

Unbekanntes Open-Weight-Modell von drbaph für lokale KI-Inferenz.

ollama pull higgs-audio-v3-studio:latest

DeepSeek-V4-Flash-GGUF

DeepSeekUnbekannt8 GB RAM

Unbekanntes Open-Weight-Modell von DeepSeek für lokale KI-Inferenz.

ollama pull deepseek-v4-flash:latest

Qwen3.5-2B-GGUF

Alibaba2B4 GB RAM

2B Open-Weight-Modell von Alibaba für lokale KI-Inferenz.

ollama pull qwen3.5-2b:2b

Qwen3.5-4B-Unzensiert-HauhauCS-Aggressiv

HauhauCS4B8 GB RAM

4B Open-Weight-Modell von HauhauCS für lokale KI-Inferenz.

ollama pull qwen3.5-4b-uncensored-hauhaucs-aggressive:4b

Qwen3.5-35B-A3B-GGUF

Alibaba35 Mrd48 GB RAM

35B Open-Weight-Modell von Alibaba für lokale KI-Inferenz.

ollama pull qwen3.5-35b-a3b:35b

Lama-3.2-3B-Anweisung-GGUF

Meta3B4 GB RAM

3B Open-Weight-Modell von Meta für lokale KI-Inferenz.

ollama pull llama-3.2-3b:3b

gemma-3-1b-it-GGUF

ggml-org1B2 GB RAM

1B Open-Weight-Modell von ggml-org für lokale KI-Inferenz.

ollama pull gemma-3-1b-it:1b

Qwen3.5-122B-A10B-MTP-GGUF

Alibaba122 Mrd80 GB RAM

122B Open-Weight-Modell von Alibaba für lokale KI-Inferenz.

ollama pull qwen3.5-122b-a10b-mtp:122b

FLUX.2-klein-4B-GGUF

Unträgheit4B8 GB RAM

4B Open-Weight-Modell von Unsloth für lokale KI-Inferenz.

ollama pull flux.2-klein-4b:4b

Qwen2.5-7B-Instruct-GGUF

Alibaba7B8 GB RAM

7B Open-Weight-Modell von Alibaba für lokale KI-Inferenz.

ollama pull qwen2.5-7b:7b

Qwen3-30B-A3B-GGUF

MaziyarPanahi30 Mrd24 GB RAM

30B Open-Weight-Modell von MaziyarPanahi für lokale KI-Inferenz.

ollama pull qwen3-30b-a3b:30b

Qwen3-32B-GGUF

MaziyarPanahi32 Mrd24 GB RAM

32B Open-Weight-Modell von MaziyarPanahi für lokale KI-Inferenz.

ollama pull qwen3-32b:32b

Qwen3-1.7B-GGUF

MaziyarPanahi1.7 Mrd4 GB RAM

1.7B Open-Weight-Modell von MaziyarPanahi für lokale KI-Inferenz.

ollama pull qwen3-1.7b:1.7b

Kimi-K3-GGUF

UnträgheitUnbekannt8 GB RAM

Unbekanntes Open-Weight-Modell von Unsloth für lokale KI-Inferenz.

ollama pull kimi-k3:latest

Qwen2.5-0.5B-Instruct-GGUF

Qwen0.5 Mrd2 GB RAM

0.5B Open-Weight-Modell von Qwen für lokale KI-Inferenz.

ollama pull qwen2.5-0.5b:0.5b

Qwen3-14B-GGUF

MaziyarPanahi14 Mrd24 GB RAM

14B Open-Weight-Modell von MaziyarPanahi für lokale KI-Inferenz.

ollama pull qwen3-14b:14b

Qwen3-0.6B-GGUF

MaziyarPanahi0.6 Mrd2 GB RAM

0.6B Open-Weight-Modell von MaziyarPanahi für lokale KI-Inferenz.

ollama pull qwen3-0.6b:0.6b

Laguna-S-2.1-GGUF

UnträgheitUnbekannt8 GB RAM

Unbekanntes Open-Weight-Modell von Unsloth für lokale KI-Inferenz.

ollama pull laguna-s-2.1:latest

Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V7-GGUF

LuffyTheFox35 Mrd48 GB RAM

35B Open-Weight-Modell von LuffyTheFox für lokale KI-Inferenz.

ollama pull qwen3.6-35b-a3b-uncensored-genesis-hermes-v7:35b

gemma-gguf

rahul7starUnbekannt8 GB RAM

Unbekanntes Open-Weight-Modell von rahul7star für lokale KI-Inferenz.

ollama pull gemma:latest

Qwen2.5-VL-7B-Instruct-GGUF

Alibaba7B8 GB RAM

7B Open-Weight-Modell von Alibaba für lokale KI-Inferenz.

ollama pull qwen2.5-vl-7b:7b

Qwen3-235B-A22B-GGUF

Alibaba235 Mrd80 GB RAM

235B Open-Weight-Modell von Alibaba für lokale KI-Inferenz.

ollama pull qwen3-235b-a22b:235b

Voxtral-Small-24B-2507-gguf

Handy-Computer24 Mrd24 GB RAM

24B Open-Weight-Modell von Handy-Computer für lokale KI-Inferenz.

ollama pull voxtral-small-24b-2507:24b

Sugoi-14B-Ultra-GGUF

sugoitoolkit14 Mrd24 GB RAM

14B Open-Weight-Modell aus dem Sugoitoolkit für lokale KI-Inferenz.

ollama pull sugoi-14b-ultra:14b

Qwen3-ASR-1.7B-gguf

Handy-Computer1.7 Mrd4 GB RAM

1.7B Open-Weight-Modell von Handy-Computer für lokale KI-Inferenz.

ollama pull qwen3-asr-1.7b:1.7b

Qwen3-30B-A3B-Instruct-2507-GGUF

Alibaba30 Mrd24 GB RAM

30B Open-Weight-Modell von Alibaba für lokale KI-Inferenz.

ollama pull qwen3-30b-a3b-instruct-2507:30b

Qwen2.5-3B-Instruct-GGUF

Qwen3B4 GB RAM

3B Open-Weight-Modell von Qwen für lokale KI-Inferenz.

ollama pull qwen2.5-3b:3b

gemma-4-12b-heretic-abliterated-GGUF

Kulturrevolte12 Mrd16 GB RAM

12B Open-Weight-Modell von CultureRevolt für lokale KI-Inferenz.

ollama pull gemma-4-12b-heretic-abliterated:12b

Qwen3.5-122B-A10B-Unzensiert-HauhauCS-Aggressiv

HauhauCS122 Mrd80 GB RAM

122B Open-Weight-Modell von HauhauCS für lokale KI-Inferenz.

ollama pull qwen3.5-122b-a10b-uncensored-hauhaucs-aggressive:122b

Qwen2.5-Coder-7B-Instruct-GGUF

Qwen7B8 GB RAM

7B Open-Weight-Modell von Qwen für lokale KI-Inferenz.

ollama pull qwen2.5-coder-7b:7b

Qwen-Image-Edit-2511-GGUF

AlibabaUnbekannt8 GB RAM

Unbekanntes Open-Weight-Modell von Alibaba für lokale KI-Inferenz.

ollama pull qwen-image-edit-2511:latest

Qwen3-Coder-Next-GGUF

AlibabaUnbekannt8 GB RAM

Unbekanntes Open-Weight-Modell von Alibaba für lokale KI-Inferenz.

ollama pull qwen3-coder-next:latest

Qwen2.5-1.5B-Instruct-GGUF

Qwen1.5 Mrd4 GB RAM

1.5B Open-Weight-Modell von Qwen für lokale KI-Inferenz.

ollama pull qwen2.5-1.5b:1.5b

Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V6-GGUF

LuffyTheFox35 Mrd48 GB RAM

35B Open-Weight-Modell von LuffyTheFox für lokale KI-Inferenz.

ollama pull qwen3.6-35b-a3b-uncensored-genesis-hermes-v6:35b

Pfotenprogramme

programasweightsUnbekannt8 GB RAM

Unbekanntes Open-Weight-Modell aus programasweights für lokale KI-Inferenz.

ollama pull paw-programs:latest

Qwen2.5-Coder-32B-Instruct-GGUF

Qwen32 Mrd24 GB RAM

32B Open-Weight-Modell von Qwen für lokale KI-Inferenz.

ollama pull qwen2.5-coder-32b:32b

gemma-4-31B-it-qat-GGUF

Google31 Mrd24 GB RAM

31B Open-Weight-Modell von Google für lokale KI-Inferenz.

ollama pull gemma-4-31b-it-qat:31b

gemma-4-26B-A4B-it-ultra-uncensored-heretic-i1-GGUF

Google26 Mrd24 GB RAM

26B Open-Weight-Modell von Google für lokale KI-Inferenz.

ollama pull gemma-4-26b-a4b-it-ultra-uncensored-heretic-i1:26b

gemma-4-12B-coder-fable5-composer2.5-v1-GGUF

yuxinlu112 Mrd16 GB RAM

12B Open-Weight-Modell von yuxinlu1 für lokale KI-Inferenz.

ollama pull gemma-4-12b-coder-fable5-composer2.5-v1:12b

Inkling-GGUF

UnträgheitUnbekannt8 GB RAM

Unbekanntes Open-Weight-Modell von Unsloth für lokale KI-Inferenz.

ollama pull inkling:latest

granite-4.1-3b-GGUF

IBM Granite3B4 GB RAM

3B Open-Weight-Modell von ibm-granite für lokale KI-Inferenz.

ollama pull granite-4.1-3b:3b

Sugoi-32B-Ultra-GGUF

sugoitoolkit32 Mrd24 GB RAM

32B Open-Weight-Modell aus dem Sugoitoolkit für lokale KI-Inferenz.

ollama pull sugoi-32b-ultra:32b

Qwen3-VL-4B-Instruct-GGUF

Alibaba4B8 GB RAM

4B Open-Weight-Modell von Alibaba für lokale KI-Inferenz.

ollama pull qwen3-vl-4b:4b

madlad400-3b-mt

Google3B4 GB RAM

3B Open-Weight-Modell von Google für lokale KI-Inferenz.

ollama pull madlad400-3b-mt:3b

MiniCPM5-1B-Claude-Opus-Fable5-V2-Thinking-GGUF

GnLOLot1B2 GB RAM

1B Open-Weight-Modell von GnLOLot für lokale KI-Inferenz.

ollama pull minicpm5-1b-claude-opus-fable5-v2-thinking:1b

svara-tts-v1

kenpathUnbekannt8 GB RAM

Unbekanntes Open-Weight-Modell von KenPath für lokale KI-Inferenz.

ollama pull svara-tts-v1:latest

Qwen3.6-40B-Claude-4.6-Opus-Deckard-Heretic-Uncensored-Thinking-NEO-CODE-Di-IMatrix-MAX-GGUF

DavidAU40 Mrd48 GB RAM

40B Open-Weight-Modell von DavidAU für lokale KI-Inferenz.

ollama pull qwen3.6-40b-claude-4.6-opus-deckard-heretic-uncensored-thinking-neo-code-di-imatrix-max:40b

Holo-3.1-35B-A3B-GGUF

Hcompany35 Mrd48 GB RAM

35B Open-Weight-Modell von Hcompany für lokale KI-Inferenz.

ollama pull holo-3.1-35b-a3b:35b

gemma-4-12B-it-qat-q4_0-gguf

Google12 Mrd16 GB RAM

12B Open-Weight-Modell von Google für lokale KI-Inferenz.

ollama pull gemma-4-12b-it-qat-q4-0:12b

Qwen3.5-9B-The-Defiant-Fable-Uncensored-Heretic-NEO-IMATRIX-MAX-MTP-GGUF

DavidAU9B16 GB RAM

9B Open-Weight-Modell von DavidAU für lokale KI-Inferenz.

ollama pull qwen3.5-9b-the-defiant-fable-uncensored-heretic-neo-imatrix-max-mtp:9b

LTX-2.3-GGUF

UnträgheitUnbekannt8 GB RAM

Unbekanntes Open-Weight-Modell von Unsloth für lokale KI-Inferenz.

ollama pull ltx-2.3:latest

gemma-4-E4B-it-qat-GGUF

Google4B8 GB RAM

4B Open-Weight-Modell von Google für lokale KI-Inferenz.

ollama pull gemma-4-e4b-it-qat:4b

whisper-large-v3-turbo-gguf

Handy-ComputerUnbekannt8 GB RAM

Unbekanntes Open-Weight-Modell von Handy-Computer für lokale KI-Inferenz.

ollama pull whisper-large-v3-turbo:latest

LTX-2

DeepBeepMeepUnbekannt8 GB RAM

Unbekanntes Open-Weight-Modell von DeepBeepMeep für lokale KI-Inferenz.

ollama pull ltx-2:latest

Qwen3-4B-GGUF

Qwen4B8 GB RAM

4B Open-Weight-Modell von Qwen für lokale KI-Inferenz.

ollama pull qwen3-4b:4b

Qwen3.5-0.8B-GGUF

Alibaba0.8 Mrd2 GB RAM

0.8B Open-Weight-Modell von Alibaba für lokale KI-Inferenz.

ollama pull qwen3.5-0.8b:0.8b

Meta-Llama-3.1-8B-Instruct-GGUF

Meta8B16 GB RAM

8B Open-Weight-Modell von Meta für lokale KI-Inferenz.

ollama pull meta-llama-3.1-8b:8b

LFM2.5-1.2B-Instruct-GGUF

LiquidAI1.2 Mrd4 GB RAM

1.2 Milliarden Open-Weight-Modell von LiquidAI für lokale KI-Inferenz.

ollama pull lfm2.5-1.2b:1.2b

GLM-5.2-GGUF

UnträgheitUnbekannt8 GB RAM

Unbekanntes Open-Weight-Modell von Unsloth für lokale KI-Inferenz.

ollama pull glm-5.2:latest

canary-180m-flash-gguf

Handy-ComputerUnbekannt8 GB RAM

Unbekanntes Open-Weight-Modell von Handy-Computer für lokale KI-Inferenz.

ollama pull canary-180m-flash:latest

whisper-large-v3-gguf

Handy-ComputerUnbekannt8 GB RAM

Unbekanntes Open-Weight-Modell von Handy-Computer für lokale KI-Inferenz.

ollama pull whisper-large-v3:latest

Qwen3-8B-GGUF

Alibaba8B16 GB RAM

8B Open-Weight-Modell von Alibaba für lokale KI-Inferenz.

ollama pull qwen3-8b:8b

Jan-v3.5-4B-gguf

janhq4B8 GB RAM

4B Open-Weight-Modell von janhq für lokale KI-Inferenz.

ollama pull jan-v3.5-4b:4b

Kimi-K2.7-Code-GGUF

UnträgheitUnbekannt8 GB RAM

Unbekanntes Open-Weight-Modell von Unsloth für lokale KI-Inferenz.

ollama pull kimi-k2.7-code:latest

MiniCPM5-1B-Claude-Opus-Fable5-Thinking-GGUF

GnLOLot1B2 GB RAM

1B Open-Weight-Modell von GnLOLot für lokale KI-Inferenz.

ollama pull minicpm5-1b-claude-opus-fable5-thinking:1b

Llama-3.2-1B-Instruct-Q8_0-GGUF

Umarmungsquanten1B2 GB RAM

1B Open-Weight-Modell von Hugging-Quants für lokale KI-Inferenz.

ollama pull llama-3.2-1b-instruct-q8-0:1b

Bielik-11B-v3.0-Instruct-awq

Speakleash11 Mrd16 GB RAM

11B Open-Weight-Modell von Speakleash für lokale KI-Inferenz.

ollama pull bielik-11b-v3.0-instruct-awq:11b

Wan2.2-I2V-A14B-GGUF

QuantStack14 Mrd24 GB RAM

14B Open-Weight-Modell von QuantStack für lokale KI-Inferenz.

ollama pull wan2.2-i2v-a14b:14b

Gemma-4-31B-it-abliterated

Papiervogelscheuche31 Mrd24 GB RAM

31B Open-Weight-Modell von Paperscarecrow für lokale KI-Inferenz.

ollama pull gemma-4-31b-it-abliterated:31b

Qwen3.6-27B-Unzensiert-HauhauCS-Aggressiv

HauhauCS27 Mrd24 GB RAM

27B Open-Weight-Modell von HauhauCS für lokale KI-Inferenz.

ollama pull qwen3.6-27b-uncensored-hauhaucs-aggressive:27b

ThinkingCap-Qwen3.6-27B-GGUF

Flaschendeckel27 Mrd24 GB RAM

27B Open-Weight-Modell von bottlecapai für lokale KI-Inferenz.

ollama pull thinkingcap-qwen3.6-27b:27b

Wan2.1

DeepBeepMeepUnbekannt8 GB RAM

Unbekanntes Open-Weight-Modell von DeepBeepMeep für lokale KI-Inferenz.

ollama pull wan2.1:latest

Voxtral-Mini-4B-Realtime-2602-gguf

Handy-Computer4B8 GB RAM

4B Open-Weight-Modell von Handy-Computer für lokale KI-Inferenz.

ollama pull voxtral-mini-4b-realtime-2602:4b

Qwen_Qwen3.6-35B-A3B-GGUF

Alibaba35 Mrd48 GB RAM

35B Open-Weight-Modell von Alibaba für lokale KI-Inferenz.

ollama pull qwen-qwen3.6-35b-a3b:35b

Qwythos-9B-v2-GGUF

empero-ai9B16 GB RAM

9B Open-Weight-Modell von empero-ai für lokale KI-Inferenz.

ollama pull qwythos-9b-v2:9b

gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2-GGUF

yuxinlu112 Mrd16 GB RAM

12B Open-Weight-Modell von yuxinlu1 für lokale KI-Inferenz.

ollama pull gemma-4-12b-agentic-fable5-composer2.5-v2-3.5x-tau2:12b

Schwefel-2-Base

SulphurAIUnbekannt8 GB RAM

Unbekanntes Open-Weight-Modell von SulfurAI für lokale KI-Inferenz.

ollama pull sulphur-2-base:latest

flüstern-mittel-gguf

Handy-ComputerUnbekannt8 GB RAM

Unbekanntes Open-Weight-Modell von Handy-Computer für lokale KI-Inferenz.

ollama pull whisper-medium:latest

gemma-4-E2B-it-GGUF

Google2B4 GB RAM

2B Open-Weight-Modell von Google für lokale KI-Inferenz.

ollama pull gemma-4-e2b-it:2b

parakeet-tdt-0.6b-v3-gguf

Handy-Computer0.6 Mrd2 GB RAM

0.6B Open-Weight-Modell von Handy-Computer für lokale KI-Inferenz.

ollama pull parakeet-tdt-0.6b-v3:0.6b

Qwen3.5-9B-Unzensiert-HauhauCS-Aggressiv

HauhauCS9B16 GB RAM

9B Open-Weight-Modell von HauhauCS für lokale KI-Inferenz.

ollama pull qwen3.5-9b-uncensored-hauhaucs-aggressive:9b

gemma-4-26B-A4B-it-qat-GGUF

Google26 Mrd24 GB RAM

26B Open-Weight-Modell von Google für lokale KI-Inferenz.

ollama pull gemma-4-26b-a4b-it-qat:26b

gpt-oss-20b-GGUF

Unträgheit20 Mrd24 GB RAM

20B Open-Weight-Modell von Unsloth für lokale KI-Inferenz.

ollama pull gpt-oss-20b:20b

Qwen3-VL-8B-Instruct-abliterated-GGUF

Alibaba8B16 GB RAM

Qwen3-VL-8B-Instruct-abliterated-GGUF ist ein von Alibaba entwickeltes Bildverarbeitungsmodell mit 8 Milliarden Parametern, das vollständig von proprietären Beschränkungen befreit wurde, während die Kernfunktionen erhalten blieben. Dieses Modell eignet sich hervorragend für komplexe visuelle Schlussfolgerungen und mehrstufige Aufgaben in einem dialogorientierten Rahmen und ist daher ideal für offene Analysen und kreative Generierung in den USA. Die lokale Ausführung dieser quantisierten GGUF-Version ist für Nutzer mit GPUs der Mittelklasse äußerst praktisch und bietet hohe Inferenzgeschwindigkeiten ohne die Notwendigkeit spezieller Unternehmenshardware.

ollama pull qwen3-vl-8b-instruct-abliterated:8b

Flux2-Klein-9B-True-V2

wikeeyang9B16 GB RAM

9B Open-Weight-Modell von Wikeeyang für lokale KI-Inferenz.

ollama pull flux2-klein-9b-true-v2:9b

Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF

DavidAU27 Mrd24 GB RAM

Das Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF ist ein von DavidAU entwickeltes, umfangreiches Sprachmodell mit 27 Milliarden Parametern, das verschiedene Feinabstimmungstechniken, darunter die Unsloth- und Heretic-Methoden, kombiniert. Dieses Modell generiert hervorragend unzensierte, hochkreative und uneingeschränkte Inhalte zu unterschiedlichsten Themen und eignet sich daher ideal für Nutzer, die einen ressourcenschonenden Assistenten suchen, der mehrstufige, optimierte Antworten ohne Sicherheitsfilter liefert. Für die lokale Ausführung dieser quantisierten GGUF-Version ist eine leistungsstarke GPU mit ausreichend VRAM erforderlich, um die 27 Milliarden Parameter effizient zu verarbeiten. Die beste Performance wird auf Systemen mit High-End-Hardware für schnelle Inferenzgeschwindigkeiten erzielt.

ollama pull qwen3.6-27b-fable-fusion-711-uncensored-heretic-nm-dau-neo-max-mtp:27b

Qwen3-Coder-30B-A3B-Instruct-GGUF

Alibaba30 Mrd24 GB RAM

Qwen3-Coder-30B-A3B-Instruct-GGUF ist ein von Alibaba entwickeltes Codierungsmodell mit 30 Milliarden Parametern, das fortschrittliche Befehlsoptimierung für spezielle Aufgaben integriert. Es eignet sich hervorragend für die Generierung komplexen Codes, das Debugging und die dialogbasierte Programmierunterstützung und ist damit ideal für Entwickler in den USA, die nach leistungsstarken Lösungen suchen. Die lokale Ausführung dieses Modells erfordert aufgrund der großen Parameteranzahl viel GPU-Speicher und ist daher am besten für Benutzer mit leistungsstarker Hardware geeignet, die Wert auf reine Codierungsfähigkeit legen.

ollama pull qwen3-coder-30b-a3b:30b

gemma-4-31B-it-GGUF

Google31 Mrd24 GB RAM

31B Open-Weight-Modell von Google für lokale KI-Inferenz.

ollama pull gemma-4-31b-it:31b

Gemma-4-E4B-Unzensiert-HauhauCS-Aggressiv

HauhauCS4B8 GB RAM

Gemma-4-E4B-Uncensored-HauhauCS-Aggressive ist ein multimodales Modell mit 4 Milliarden Parametern, entwickelt von HauhauCS. Es integriert die erweiterten Funktionen von Gemma 4 mit ablativen Sicherheitsfiltern. Diese aggressive Variante eignet sich hervorragend für uneingeschränkte Textgenerierung, Bildanalyse und Audioverarbeitung und ist somit ideal für kreative Aufgaben, die eine Rohausgabe ohne Inhaltsmoderation erfordern. Die lokale Ausführung dieses Modells benötigt viel GPU-Speicher zur Verarbeitung der multimodalen Eingaben. Benutzer sollten daher mit hohen Rechenkosten bei der Verarbeitung komplexer Audio- oder Videostreams rechnen.

ollama pull gemma-4-e4b-uncensored-hauhaucs-aggressive:4b

Qwopus3.6-27B-Coder-Compat-MTP-GGUF

Jackrong27 Mrd24 GB RAM

27B Open-Weight-Modell von Jackrong für lokale KI-Inferenz.

ollama pull qwopus3.6-27b-coder-compat-mtp:27b

UI-TARS-1.5-7B-GGUF

mradermacher7B8 GB RAM

7B Open-Weight-Modell von mradermacher für lokale KI-Inferenz.

ollama pull ui-tars-1.5-7b:7b

Huihui-DeepSeek-V4-Flash-abliterated-ds4-GGUF

huihui-aiUnbekannt8 GB RAM

Unbekanntes Open-Weight-Modell von huihui-ai für lokale KI-Inferenz.

ollama pull huihui-deepseek-v4-flash-abliterated-ds4:latest

gemma-4-12B-it-QAT-GGUF

Google12 Mrd16 GB RAM

12B Open-Weight-Modell von Google für lokale KI-Inferenz.

ollama pull gemma-4-12b-it-qat:12b

Ternary-Bonsai-27B-gguf

Prisma-ml27 Mrd24 GB RAM

27B Open-Weight-Modell von prism-ml für lokale KI-Inferenz.

ollama pull ternary-bonsai-27b:27b

Gemmable-4-12B-MTP-GGUF

Mia-AiLab12 Mrd16 GB RAM

12B Open-Weight-Modell von Mia-AiLab für lokale KI-Inferenz.

ollama pull gemmable-4-12b-mtp:12b

Qwopus3.6-35B-A3B-Coder-MTP-GGUF

Jackrong35 Mrd48 GB RAM

35B Open-Weight-Modell von Jackrong für lokale KI-Inferenz.

ollama pull qwopus3.6-35b-a3b-coder-mtp:35b

Qwen3.6-35B-A3B-MTP-GGUF

Alibaba35 Mrd48 GB RAM

35B Open-Weight-Modell von Alibaba für lokale KI-Inferenz.

ollama pull qwen3.6-35b-a3b-mtp:35b

gemma-4-12b-it-GGUF

Google12 Mrd16 GB RAM

12B Open-Weight-Modell von Google für lokale KI-Inferenz.

ollama pull gemma-4-12b-it:12b

Qwen3-VL-30B-A3B-Instruct-GGUF

Qwen30 Mrd24 GB RAM

30B Open-Weight-Modell von Qwen für lokale KI-Inferenz.

ollama pull qwen3-vl-30b-a3b:30b

Modelle verschoben

ggml-orgUnbekannt8 GB RAM

Die Sammlung „models-moved“ wird von ggml-org bereitgestellt und weist derzeit eine unbekannte Anzahl an Parametern für ihre verschiedenen Modelldateien auf. Diese Modelle eignen sich hervorragend für allgemeine Aufgaben in den USA und sind besonders für Nutzer geeignet, die nach leicht zugänglichen Inferenzoptionen dieses Anbieters suchen. Für die lokale Ausführung müssen die entsprechenden GGUF-Quantisierungsdateien heruntergeladen werden, wobei die Leistung je nach GPU- oder CPU-Hardware erheblich variiert.

ollama pull models-moved:latest

cohere-transcribe-03-2026-gguf

Handy-ComputerUnbekannt8 GB RAM

Unbekanntes Open-Weight-Modell von Handy-Computer für lokale KI-Inferenz.

ollama pull cohere-transcribe-03-2026:latest

Qwen-AgentWorld-35B-A3B-GGUF

Alibaba35 Mrd48 GB RAM

35B Open-Weight-Modell von Alibaba für lokale KI-Inferenz.

ollama pull qwen-agentworld-35b-a3b:35b

vntl-llama3-8b-v2-gguf

lmg-anon8B16 GB RAM

Das Sprachmodell vntl-llama3-8b-v2-gguf mit 8 Milliarden Parametern wurde von lmg-anon entwickelt und ist auf hochwertige Übersetzungen und Konversationsaufgaben spezialisiert. Es eignet sich hervorragend für die Verarbeitung des VNTL-v5-1k-Datensatzes und liefert flüssige Antworten, wodurch es ideal für mehrsprachige Chat-Anwendungen und die Generierung lokalisierter Inhalte ist. Für die lokale Ausführung dieses Modells wird eine GPU mit ausreichend VRAM benötigt, um die 8 Milliarden Parameter effizient zu verarbeiten und so eine reaktionsschnelle Performance für Echtzeitdialoge zu gewährleisten.

ollama pull vntl-llama3-8b-v2:8b

gemma-4-E4B-it-GGUF

Google4B8 GB RAM

Das gemma-4-E4B-it-GGUF ist ein von Google entwickeltes Sprachmodell mit vier Milliarden Parametern, das mithilfe der GGUF-Quantisierung für Italienisch optimiert wurde. Es eignet sich hervorragend für komplexe Schlussfolgerungsaufgaben innerhalb der Gemma-4-Architektur und unterstützt effiziente Bild-zu-Text-Konvertierungen durch spezielle Unsloth-Optimierungen. Um die hohe Geschwindigkeit dieses Modells lokal auszunutzen, ist eine moderne GPU erforderlich. Daher ist es ideal für Anwender, die eine leistungsstarke lokale Inferenz ohne Cloud-Abhängigkeiten benötigen.

ollama pull gemma-4-e4b-it:4b

Qwen3.6-27B-GGUF

Alibaba27 Mrd24 GB RAM

Qwen3.6-27B-GGUF ist ein von Alibaba entwickeltes, umfangreiches Sprachmodell mit 27 Milliarden Parametern, das fortschrittliche Konversations-KI und Bild-zu-Text-Funktionen unterstützt. Es eignet sich hervorragend für komplexe Schlussfolgerungsaufgaben, mehrsprachige Kommunikation und visuelle Analyse und ist daher ideal für professionelle Anwendungen, die eine hohe Genauigkeit bei der Textgenerierung und -interpretation erfordern. Die lokale Ausführung dieses Modells benötigt in der Regel viel GPU-Speicher und einen leistungsstarken Prozessor, um die 27 Milliarden Parameter effizient zu verarbeiten. Daher ist es am besten für Nutzer mit dedizierter Hardware oder Zugriff auf Cloud-Instanzen geeignet.

ollama pull qwen3.6-27b:27b

Qwen3.6-35B-A3B-GGUF

Alibaba35 Mrd48 GB RAM

Qwen3.6-35B-A3B-GGUF ist ein von Alibaba entwickeltes, 35 Milliarden Parameter umfassendes Sprachmodell mit speziellen Optimierungen für die Bild-zu-Text-Konvertierung und mehrsprachige Konversation. Es eignet sich hervorragend für komplexe visuelle Analyseaufgaben und die Aufrechterhaltung eines kohärenten Dialogs und ist daher ideal für Anwendungen, die ein tiefes Kontextverständnis über verschiedene Themenbereiche hinweg erfordern. Die lokale Ausführung dieses Modells benötigt aufgrund der hohen Parameteranzahl viel GPU-Speicher. Quantisierte GGUF-Versionen bieten jedoch ein gutes Verhältnis zwischen Geschwindigkeit und Leistung auf leistungsstarker Consumer-Hardware.

ollama pull qwen3.6-35b-a3b:35b

Hy3-GGUF

vcruz305Unbekannt8 GB RAM

Unbekanntes Open-Weight-Modell von vcruz305 für lokale KI-Inferenz.

ollama pull hy3:latest

HyperCLOVAX-SEED-Text-Instruct-1.5B-Q4_K_M-GGUF

rippertnt1.5 Mrd4 GB RAM

HyperCLOVAX-SEED-Text-Instruct-1.5B-Q4_K_M-GGUF ist ein Sprachmodell mit 1.5 Milliarden Parametern, das von rippertnt entwickelt und für die Verwendung mit llama-cpp optimiert wurde. Es eignet sich hervorragend für Konversationsaufgaben und die allgemeine Textgenerierung und ist daher ideal für ressourcenschonende Anwendungen, die eine effiziente Inferenz auf Standardhardware erfordern. Dank seines quantisierten Formats lässt sich dieses Modell auch auf weniger leistungsstarken Systemen lokal ausführen und bietet schnelle Reaktionszeiten ohne die Notwendigkeit von High-End-GPUs.

ollama pull hyperclovax-seed-text-instruct-1.5b-q4-k-m:1.5b

Qwen3.5-9B-GGUF

Alibaba9B16 GB RAM

Qwen3.5-9B-GGUF ist ein kompaktes, großes Sprachmodell von Alibaba mit 9 Milliarden Parametern. Es eignet sich hervorragend für Konversationsaufgaben und die Bild-zu-Text-Konvertierung und ist daher ideal für ressourcenschonende Anwendungen, die eine effiziente Bereitstellung in den USA erfordern. Dank seines geringen Speicherbedarfs lässt sich dieses Modell lokal auf handelsüblicher Hardware ausführen und bietet in Kombination mit Optimierungsbibliotheken wie Unsloth selbst auf leistungsschwächeren GPUs hohe Inferenzgeschwindigkeiten.

ollama pull qwen3.5-9b:9b

Qwen3.5-4B-GGUF

Alibaba4B8 GB RAM

Qwen3.5-4B-GGUF ist ein kompaktes Sprachmodell mit 4 Milliarden Parametern, entwickelt von Alibaba, das Konversationsaufgaben und die Umwandlung von Bildern in Text unterstützt. Es eignet sich hervorragend für die Verarbeitung leichter Inferenzlasten und bietet gleichzeitig eine hohe Leistung in Umgebungen, die für die Textgenerierung optimiert sind. Da das Modell lokal ausgeführt werden muss, benötigt es nur minimale Hardware-Ressourcen und ist daher ideal für Anwender, die eine schnelle und effiziente Bereitstellung auf gängigen Endgeräten wünschen.

ollama pull qwen3.5-4b:4b

parakeet-unified-en-0.6b-gguf

Handy-Computer0.6 Mrd2 GB RAM

0.6B Open-Weight-Modell von Handy-Computer für lokale KI-Inferenz.

ollama pull parakeet-unified-en-0.6b:0.6b

nemotron-3.5-asr-streaming-0.6b-gguf

Handy-Computer0.6 Mrd2 GB RAM

0.6B Open-Weight-Modell von Handy-Computer für lokale KI-Inferenz.

ollama pull nemotron-3.5-asr-streaming-0.6b:0.6b

gemma-4-26B-A4B-it-GGUF

Google26 Mrd24 GB RAM

Das gemma-4-26B-A4B-it-GGUF ist ein von Google entwickeltes, 26 Milliarden Parameter umfassendes Sprachmodell, das fortschrittliches Befehlstuning für leistungsstarkes logisches Schließen nutzt. Dieses Modell eignet sich hervorragend für die Generierung komplexer Texte und multimodale Aufgaben und ist daher ideal für Anwendungen, die ein tiefes Kontextverständnis und die präzise Befolgung von Anweisungen erfordern. Die lokale Ausführung dieses Modells benötigt viel GPU-Speicher und erhebliche Rechenleistung und ist daher am besten für Nutzer mit High-End-Hardware oder solche geeignet, die Inferenz-Frameworks wie Unsloth zur Ressourcenoptimierung einsetzen.

ollama pull gemma-4-26b-a4b-it:26b

Bonsai-27B-gguf

Prisma-ml27 Mrd24 GB RAM

Bonsai-27B-gguf ist ein kompaktes Sprachmodell mit 27 Milliarden Parametern, entwickelt von prism-ml, das Quantisierung für eine effiziente Bereitstellung nutzt. Es eignet sich hervorragend für Konversationsaufgaben und allgemeines logisches Denken und läuft reibungslos auf llama.cpp mit Unterstützung für CPU- und CUDA-Hardwarebeschleunigung. Benutzer können dieses Modell lokal auf einfacher Hardware ausführen, wobei die Leistung je nach Verwendung von 1-Bit-Quantisierung oder Zugriff auf eine GPU variiert.

ollama pull bonsai-27b:27b

Qwen3.6-35B-A3B-Unzensiert-HauhauCS-Aggressiv

HauhauCS35 Mrd48 GB RAM

Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive ist ein von HauhauCS entwickeltes, 35 Milliarden Parameter umfassendes Sprachmodell, das die Mixture-of-Experts-Architektur mit fortschrittlichen multimodalen und visuellen Funktionen kombiniert. Es eignet sich hervorragend für komplexes Schließen, mehrsprachige Bild-Text-Analyse und die Generierung unzensierter Inhalte für aggressive oder uneingeschränkte Anwendungsfälle, in denen Standard-Sicherheitsfilter unerwünscht sind. Die lokale Ausführung dieses Modells erfordert aufgrund seiner spärlichen Mixture-of-Experts-Struktur erheblichen High-End-GPU-Speicher und ist daher am besten für leistungsstarke Workstations oder Server mit ausreichend verfügbarem VRAM geeignet.

ollama pull qwen3.6-35b-a3b-uncensored-hauhaucs-aggressive:35b

Qwythos-9B-Claude-Mythos-5-1M-GGUF

empero-ai9B16 GB RAM

9B Open-Weight-Modell von empero-ai für lokale KI-Inferenz.

ollama pull qwythos-9b-claude-mythos-5-1m:9b

Ornith-1.0-35B-GGUF

ornith-ai35 Mrd48 GB RAM

Ornith-1.0-35B-GGUF ist ein Sprachmodell mit 35 Milliarden Parametern, das von ornith-ai speziell für Konversationsaufgaben im US-amerikanischen Raum entwickelt wurde. Es zeichnet sich durch die Aufrechterhaltung natürlicher Dialogabläufe und die Verarbeitung kontextbezogener Interaktionen aus und ist daher ideal für Chatbots und virtuelle Assistenten. Die lokale Ausführung dieses Modells erfordert aufgrund seiner Größe viel GPU-Speicher und eignet sich daher am besten für Nutzer mit leistungsstarker Hardware oder solche, die bereit sind, quantisierte GGUF-Versionen zu verwenden, um den Ressourcenbedarf zu reduzieren.

ollama pull ornith-1.0-35b:35b

Qwen3.6-27B-MTP-GGUF

Alibaba27 Mrd24 GB RAM

Qwen3.6-27B-MTP-GGUF ist ein von Alibaba entwickeltes, 27 Milliarden Parameter umfassendes Sprachmodell, das fortgeschrittene Konversationsaufgaben und die Umwandlung von Bildern in Text unterstützt. Es eignet sich hervorragend für komplexe Schlussfolgerungen und mehrstufige Dialoge und ist daher ideal für Anwendungen, die ein tiefes Kontextverständnis und visuelle Analysen erfordern. Die lokale Ausführung dieses Modells erfordert in der Regel leistungsstarke GPU-Hardware, um den großen Speicherbedarf zu bewältigen. Quantisierte GGUF-Versionen bieten jedoch ein gutes Verhältnis zwischen Geschwindigkeit und Leistung auf Consumer-Systemen.

ollama pull qwen3.6-27b-mtp:27b

deepseek-v4.gguf

antirezUnbekannt8 GB RAM

Das deepseek-v4-gguf-Modell ist eine quantisierte Mixture-of-Experts-Architektur von antirez mit unbekannter Parameteranzahl, die in 2-Bit- und 4-Bit-Formaten verfügbar ist. Es zeichnet sich durch effiziente Inferenz bei großen Sprachverarbeitungsaufgaben aus und bietet dank seiner speziellen MoE-Struktur eine hohe Leistung. Dadurch ist es ideal für Anwender, die einen geringen Speicherbedarf ohne signifikante Leistungseinbußen benötigen. Die lokale Ausführung dieses Modells erfordert moderate Hardware-Ressourcen zur effektiven Verarbeitung der quantisierten Gewichte und bietet somit eine schnelle und praktische Lösung für den Einsatz fortschrittlicher KI-Funktionen auf Consumer-Systemen.

ollama pull deepseek-v4:latest

Ornith-1.0-9B-GGUF

ornith-ai9B16 GB RAM

Ornith-1.0-9B-GGUF ist ein Sprachmodell mit 9 Milliarden Parametern, entwickelt von ornith-ai für die Konversation in den USA. Es eignet sich hervorragend zur Generierung natürlicher Dialoge und zur Bewältigung alltäglicher Chat-Aufgaben und ist daher ideal für schlanke virtuelle Assistenten oder einfache Kundensupport-Bots. Da das Modell lokal mit geringen Hardware-Ressourcen ausgeführt werden kann, läuft es schnell auf handelsüblichen GPUs, ohne dass große Rechenzentren erforderlich sind.

ollama pull ornith-1.0-9b:9b

Hallo, schön dich kennen zu lernen! ????

Abonnieren Sie unseren Newsletter, um die neuesten KI-Nachrichten zu erhalten.

Malcare WordPress-Sicherheit