llama.cpp · Fund
llama.cpp 0.4.0 bringt --lazy-mode für das Lesen von Tensoren bei Bedarf
Vom Abgerufen Themen Lokal betreiben
Die Übersicht der Ausgabe nennt Qwen3.8-Flash-Next und Nemotron-3-Puzzle, das Lesen von Tensoren bei Bedarf, ein Kontextlimit je Steckplatz, Videooptionen und ggml 0.23.0.