DeepSeek · Fund
DeepSeek-V4.1-Flash unter MIT-Lizenz, 552B Backbone-Parameter, 1M Token Kontext
Vom Abgerufen Themen Offene Modelle
Aktiv sind je Token 8B Parameter beim Prefill und 16B beim Decode, der globale KV-Cache liegt bei 890 Byte je Token; eine Jinja-Chatvorlage fehlt, dafür eine Python-Referenz und deepseek-recipe.