Job Search Agent / 2026. augusztus 9.
A scraper néha fél oldalt egyetlen álláshirdetésnek hitt
A rangsorolási hibák egy része nem scoring bug volt, hanem adatminőségi probléma: aggregátor navigáció, több listing és oldalszöveg keveredett egy rekordba.
A helyzet
No Fluff és más HTML források esetén a crawler néha nem tiszta detail oldalt kapott, hanem olyan sűrű listing blobot, amelyben több állás címe, navigációs szöveg és salary fragment is együtt volt. A ranking ezután teljes komolysággal pontozta a szemetet. Minél intelligensebb a scorer, annál magabiztosabban tud rossz inputból rossz döntést hozni.
A megoldási út
A pipeline elején kezdtem javítani: navigation artifact szűrés, dense listing blob detektálás, safe detail hydration és dedupe során a tiszta detail rekord preferálása került be. A Best Match curationt csak olyan rekordra engedtem, amely mögött tényleges detail evidence állt. A ranking diagnostika megmutatta, mely inputmezők alapján született döntés.
Mi lett belőle
Sok false positive eltűnt anélkül, hogy a scoring súlyait agresszíven át kellett volna hangolni. A rendszer kevésbé próbált okos lenni rossz HTML-en, és inkább jelezte, ha nincs elég tiszta adat a magabiztos rangsoroláshoz.