Descrizione
Scarica una pagina web e ne estrae SOLO il testo leggibile come stringa pulita per pipeline AI. Strip aggressivo via cheerio: rimuove <script>, <style>, <nav>, <footer>, <aside>, commenti HTML, white-space ridondante. Output ottimizzato per LLM prompt (token economy) o storage searchable, non per parsing strutturato. Differenza con i sibling: action_fetch_url = quick text-only extraction zero-config (1 URL → 1 stringa). Per HTML completo con header browser-like + cookie jar usa action_web_fetch_advanced (più opzioni, più verbose). Per parsing strutturato con CSS selector usa action_html_select. Per scraping SPA JS-heavy usa action_browser_render (BYO). Per orchestrazione multi-stage adaptive con AI extract usa action_scrape_smart. Limiti by-design (no surprise pricing/abuse): max 100 KB output (~25k token Claude — oltre il quale conviene split + summarize), timeout 10s connect+read, follow redirect max 5 hop, content-type filter (accetta solo text/html, application/xhtml — un binary mascherato da HTML viene rifiutato). Sicurezza: SSRF-guarded via @flowforge/safe-fetch (blocca 127.0.0.1, 10.x/172.16-31/192.168.x, link-local 169.254.x, IPv6 fc00::/7), User-Agent identifica FlowForge per audit-friendly upstream (rispetta robots.txt — un sito può bloccarci by-design). Audit log su ogni fetch con url + status + bytes per forensics e cost monitoring. Use case: (1) iniettare contenuto landing-page competitor in prompt LLM per analisi posizionamento, (2) pre-processare FAQ pubblica della propria docs per indicizzazione RAG con embedding BGE-M3, (3) raccogliere testo articolo news per pipeline agent_summarizer + agent_classifier, (4) verifica SEO che la propria pagina prodotto contenga keyword target (text density check). Safety budget: cap 100 KB protegge da abuso bandwidth, timeout 10s previene workflow hang, SSRF cap previene attacchi internal-network reconnaissance.
