Zoltán Horváth
← Munkanapló

Job Search Agent / 2026. augusztus 9.

A scraper néha fél oldalt egyetlen álláshirdetésnek hitt

A rangsorolási hibák egy része nem scoring bug volt, hanem adatminőségi probléma: aggregátor navigáció, több listing és oldalszöveg keveredett egy rekordba.

2 perc olvasás
scrapingdata-qualityrankingNo Fluff

A helyzet

No Fluff és más HTML források esetén a crawler néha nem tiszta detail oldalt kapott, hanem olyan sűrű listing blobot, amelyben több állás címe, navigációs szöveg és salary fragment is együtt volt. A ranking ezután teljes komolysággal pontozta a szemetet. Minél intelligensebb a scorer, annál magabiztosabban tud rossz inputból rossz döntést hozni.

A megoldási út

A pipeline elején kezdtem javítani: navigation artifact szűrés, dense listing blob detektálás, safe detail hydration és dedupe során a tiszta detail rekord preferálása került be. A Best Match curationt csak olyan rekordra engedtem, amely mögött tényleges detail evidence állt. A ranking diagnostika megmutatta, mely inputmezők alapján született döntés.

Mi lett belőle

Sok false positive eltűnt anélkül, hogy a scoring súlyait agresszíven át kellett volna hangolni. A rendszer kevésbé próbált okos lenni rossz HTML-en, és inkább jelezte, ha nincs elég tiszta adat a magabiztos rangsoroláshoz.