Web: Fetch URL → testo

action_fetch_url · action · HTTP & Webhook · Disponibile · v1.0.0

Descrizione

Scarica una pagina web e ne estrae SOLO il testo leggibile come stringa pulita per pipeline AI. Strip aggressivo via cheerio: rimuove <script>, <style>, <nav>, <footer>, <aside>, commenti HTML, white-space ridondante. Output ottimizzato per LLM prompt (token economy) o storage searchable, non per parsing strutturato. Differenza con i sibling: action_fetch_url = quick text-only extraction zero-config (1 URL → 1 stringa). Per HTML completo con header browser-like + cookie jar usa action_web_fetch_advanced (più opzioni, più verbose). Per parsing strutturato con CSS selector usa action_html_select. Per scraping SPA JS-heavy usa action_browser_render (BYO). Per orchestrazione multi-stage adaptive con AI extract usa action_scrape_smart. Limiti by-design (no surprise pricing/abuse): max 100 KB output (~25k token Claude — oltre il quale conviene split + summarize), timeout 10s connect+read, follow redirect max 5 hop, content-type filter (accetta solo text/html, application/xhtml — un binary mascherato da HTML viene rifiutato). Sicurezza: SSRF-guarded via @flowforge/safe-fetch (blocca 127.0.0.1, 10.x/172.16-31/192.168.x, link-local 169.254.x, IPv6 fc00::/7), User-Agent identifica FlowForge per audit-friendly upstream (rispetta robots.txt — un sito può bloccarci by-design). Audit log su ogni fetch con url + status + bytes per forensics e cost monitoring. Use case: (1) iniettare contenuto landing-page competitor in prompt LLM per analisi posizionamento, (2) pre-processare FAQ pubblica della propria docs per indicizzazione RAG con embedding BGE-M3, (3) raccogliere testo articolo news per pipeline agent_summarizer + agent_classifier, (4) verifica SEO che la propria pagina prodotto contenga keyword target (text density check). Safety budget: cap 100 KB protegge da abuso bandwidth, timeout 10s previene workflow hang, SSRF cap previene attacchi internal-network reconnaissance.

⚙️ Parametri di configurazione

Campi mostrati nell’editor quando si configura il nodo. Generati direttamente dal NodeDefconfigFields.

CampoTipoRequiredDefaultDescrizione
url
URL da scaricare
expressionsi
https://example.com/articolo
URL completa http:// o https://. SSRF guard attivo: host localhost/127.x.x.x/192.168.x.x/10.x.x.x bloccati. Supporta espressioni: {{$node.trigger.json.url}}.
maxBytes
Max bytes risposta (opzionale)
numberno100000Default 100KB. Se la pagina è più grande, viene troncata. Output include `truncatedChars` per sapere quanto è stato tagliato.

⬆️ Output del nodo

Campi disponibili nei nodi successivi via $node.<alias>.json.<field>:

  • url
  • finalUrl
  • status
  • title
  • description
  • content
  • contentType
  • truncatedChars

💡 Esempio configurazione

Snippet JSON del nodo come compare nel workflow. I valori sono derivati daidefaultValue e dai parametri required.

{
  "id": "node-action_fetch_url-1",
  "defId": "action_fetch_url",
  "label": "Web: Fetch URL → testo",
  "config": {
    "url": "https://example.com/articolo",
    "maxBytes": 100000
  }
}

🔗 Nodi correlati nella stessa categoria

Pronto a usare Web: Fetch URL → testo?

Disponibile da subito in tutti i piani FlowForge. Provalo gratis senza carta di credito.

Inizia gratisSfoglia tutti i nodi