Descrizione
Mini-agente enterprise di contact discovery che parte da un URL homepage di una azienda e NAVIGA sistematicamente il sito web alla ricerca della email business più probabile, simulando il pattern di ricerca manuale che un sales rep usa quando esamina il prospect per identificare il contact point. Pipeline di navigation strutturata multi-fase: (1) crawl della homepage primaria con extraction di tutte le link visibili nel header/footer, (2) ricerca automatic delle "smart pages" tipiche per contact information — /contatti /contact /contact-us /chi-siamo /about /about-us /team /staff /impressum (la pagina obbligatoria per legge tedesca con dati aziendali) /contattaci /legal /privacy con varianti multi-lingua del path, (3) parse del sitemap.xml ufficiale per discovery pagine dedicate non linkate dalla home, (4) fallback strategy via DuckDuckGo search restricted al dominio "site:acme.com contact email" per trovare pagine nascoste dalla navigation principale. Vocabolario multi-lingua nativo per riconoscere le label di pagine "contatti" in 14 lingue diverse: italiano (Contatti, Contattaci, Chi siamo, Lavora con noi), inglese (Contact, Contact Us, About, Team), tedesco (Kontakt, Impressum — obbligatorio per legge DE, Über uns, Team), francese (Contact, À propos, Équipe), spagnolo (Contacto, Acerca de, Equipo), portoghese (Contato, Sobre, Equipa), olandese (Contact, Over ons), greco (Επικοινωνία, Σχετικά), scandinavi svedese/norvegese/danese/finlandese/islandese, croato (Kontakt). Coverage tipica EU + USA + qualche emerging market. Rispetta robots.txt scrupolosamente (un publisher può escludere /admin/ /login/ e qualsiasi path che NON vuole sia crawlato — il nodo skipa quei path), rate-limit 2 req/sec per host (good-citizen standard per non risultare aggressive scanner che il publisher considererebbe abuse), cache LRU 7 giorni per host normalizzato (workflow batch su 1000 lead della stessa azienda non ricrawlano la stessa azienda 1000 volte). Zero LLM dependency nel core algorithm — questo è un IMPORTANTE feature: il crawl è deterministico (stesso input → SEMPRE stesso output per audit + reproducibility), no costo per-token, no exposure di dati PII del prospect a provider LLM esterni (GDPR-friendly), no dipendenza da API rate-limit di LLM esterni. Il LLM si può aggiungere downstream per personalization come opt-in. Output: email primaria (la più probabile da contattare — typically person email > role-based info@), tutte le email trovate con confidence score, pagina specifica dove trovata (per audit trail), lista di path tentati (per debug se non trovate). Use case: lead-gen B2B con discovery deterministica zero-LLM-cost (loop su 1000 company URL → contact discovery → email validation MX → personalization → outreach); arricchimento CRM partendo solo dal dominio aziendale (un sales rep ha solo "@acme.com" → workflow → email reale del decision-maker); verifica audit-friendly che la propria pagina /contatti renda email crawlable per accessibility e SEO; outreach internazionale multi-lingua senza traduzioni manuali (German DACH market via Impressum detection); pre-flight check di lead lists comprate da broker (verifica che gli URL aziendali del lead db hanno effettivamente contact reali → cleansing del dataset acquistato).
