Job Search Agent / 2026. augusztus 9.
A lokális LLM nem lassú — ha nem minden kérdésnél hidegen indítjuk
Az Ollama requirement review túl sok latencyt kapott a modellindításból és felesleges reasoningből. Warmup, retry és strukturált no-thinking fast path tette használhatóvá.
A helyzet
Lokális LLM-nél az első kérés jelentősen lassabb lehet, mert a modell még nincs memóriában. Ha egy automation ezt timeoutként értelmezi, a rendszer véletlenszerűen hibásnak látszik. Ráadásul requirement extractionnél nem kreatív többperces gondolkodás kellett, hanem rövid, schema-konform információkinyerés.
A megoldási út
Startupkor warmupot adtam a modellnek, a health/smoke ellenőrzés pedig retry-t kapott a tényleges boot időre. A requirement extraction külön strukturált no-thinking provider utat használt, amely pontos JSON-szerű kimenetre optimalizált. A task timeoutot különválasztottam az infrastruktúra elérhetetlenségétől, hogy más recovery tartozzon hozzájuk.
Mi lett belőle
Az Ollama review kiszámíthatóbb és gyorsabb lett. A hidegindítás nem nézett ki modellhibának, és az egyszerű extraction nem fizette meg egy általános reasoning kör teljes költségét. A diagnosztika világosan jelezte, cache hit, timeout vagy provider outage történt-e.