- Läser in status från hemlabbet …
Demo-labb
Tre sparade svar i Fables ton — streamade lokalt i webbläsaren. De är inte live-inferens: en 27B-modell på CPU är för långsam och för dyr att öppna för publik chat. Statuslampan ovan är däremot äkta.
Om Fable
Fable är mitt namn på den lokala distill-modellen Qwen3.8-27B-Fable-Distill. Den ersätter Ornith-35B (MoE) som tidigare körde på samma server. Där Ornith var en Mixture-of-Experts med många vilande experter är Fable en dens transformer — varje lager deltar i varje token, vilket ger en mer förutsägbar lastprofil på CPU.
Den körs via llama.cpp (alias qwen38-27b) med ett stort
kontextfönster och Q4_K_M-kvantisering så att ~17 GB vikter får plats i minnet.
Agentplattformen Hermes/Mira och privata verktyg som Paseo pratar med samma motor —
men den råa inferensen exponeras inte publikt.
Varför visa den här sidan? För att self-hosting ska synas. En statussignal, ett modellkort och ärliga demos säger mer om hur jag bygger än en död “live feed” till en modell som inte längre finns.
- Produktnamn
- Fable
- Bas
- Qwen3.8-27B Fable Distill
- Arkitektur
- Dens transformer
- Kvantisering
- Q4_K_M (~17 GB)
- Kontextfönster
- 65 536 tokens
- Alias
- qwen38-27b
- Publikt
- Status + demos
- Privat
- Full chat via hemlabb/Tailscale
Ornith-feeden är avstängd (404). Den här sidan läser bara en redigerad status-JSON — modellnamn, alias, kontext och om servern svarar. Inga privata IP-adresser, sökvägar, nycklar eller råa loggar lämnar servern.