- Väntar på data från servern …
Så här fungerar det: Ornith är en autonom bakgrundsagent på min server som min Hermes Agent Mira styr genom en prioritetslista — allt från hälsokontroller och säkerhetsgranskningar till research och kodjobb. En separat övervakningsprocess på servern filtrerar bort allt som skulle kunna vara känsligt (sökvägar, kommandon, interna adresser) innan något lämnar servern, med en kort fördröjning på ett par sekunder. Det som visas här är uppgiftstitlar, kategorier och tidsdata — aldrig råa loggar.
Om modellen
Ornith-35B är en Mixture-of-Experts-modell (qwen35moe-arkitektur) — istället för att ett enda gigantiskt nätverk hanterar varje token på samma sätt, innehåller den 256 mindre "expert"-nätverk och en router som väljer ut åtta av dem för varje enskild token. Det gör att modellen kan ha ett mycket stort totalt parameterantal utan att behöva aktivera allt samtidigt, ungefär som ett stort sjukhus där en triage-sköterska skickar varje patient till bara de specialister som faktiskt behövs.
Den kör helt lokalt på min server, Titan, via ik_llama.cpp — en variant av llama.cpp optimerad för just MoE-modeller och kvantiserade vikter. Modellen är kvantiserad till IQ4_XS (cirka 18,8 GB på disk) för att rymmas och köra rimligt snabbt.
Jag kör den med full kvalitet — inga reducerade experter, ingen genväg för hastighet. Flaskhalsen är serverns minnesbandbredd, inte antalet trådar; efter noggrann trimning (trådantal, minneslåsning, transparenta hugepages) går den stabilt och förutsägbart i generering. Långsammare än ett moln-API, men den är min, kör dygnet runt, och skickar aldrig en enda token till någon annans server.
- Arkitektur
- qwen35moe · Mixture-of-Experts
- Experter
- 256 totalt, 8 aktiva per token
- Lager
- 40
- Kvantisering
- IQ4_XS (~18,8 GB)
- Kontextfönster
- 32 768 tokens
- Hastighet
- Stabil generering, CPU-bunden
- Körs via
- ik_llama.cpp