Autor rankinguje 11 otwartych harness dla agentów AI pracujących z lokalnymi modelami językowymi, biorąc pod uwagę jakość dokumentacji obsługi lokalnej inferenceji. Harness to nie tylko model, ale cały system: uruchamia narzędzia, zarządza stanem, kontroluje uprawnienia i przesyła kontekst z powrotem do modelu. W przypadku modeli lokalnych ta infrastruktura ma decydujące znaczenie, bo słabsze okna kontekstowe i niezawodne tool calling odsłaniają każdą wadę projektu.

Recenzja wyznacza trzy niezmienne reguły dla każdego harness. Po pierwsze, trzeba najpierw rozszerzyć okno kontekstu - domyślnie Ollama przydziela 4 tys. tokenów poniżej 24 GB VRAM, 32 tys. przy 24-48 GB, a 256 tys. powyżej 48 GB. Dla agentów i narzędzi do kodowania powinno być minimum 64 tys. tokenów (zmiana wymaga jednej linii: OLLAMA_CONTEXT_LENGTH=64000 ollama serve). Po drugie, wybrać model wspierający tool calling - bez tego możliwe jest tylko chat completion. Po trzecie, szczerze ocenić dostępną pamięć: 16-32 GB RAM to małe skwantyzowane modele, 32-64 GB to średnie modele do kodowania, powyżej 64 GB większe modele.

Ranking uwzględnia licencję zatwierdzoną przez OSI, dostępność dokumentacji dla lokalnych runtimes (takich jak Ollama, LM Studio czy llama.cpp), aktywność utrzymania i wbudowane mechanizmy bezpieczeństwa. Przewodnik podkreśla, że infrastruktura harness ma coraz większe znaczenie - z mocnymi modelami w chmurze można żyć mimo słabego designu, ale lokalne modele wymagają starannie zaprojektowanego systemu.