π― Cos'Γ¨ questo pacchetto?
Un crawler PHP che puoi caricare sul tuo server per scannerizzare automaticamente il tuo sito web senza le limitazioni CORS del browser. Una volta installato, potrai usarlo con il Generatore Sitemap di FederCreations.
π‘ PerchΓ© serve?
I browser bloccano le richieste JavaScript tra domini diversi (CORS). Questo crawler gira sul tuo server, quindi puΓ² accedere a tutte le pagine del tuo sito senza restrizioni.
βοΈ Requisiti
β
PHP 7.0+
Versione PHP compatibile
β
Accesso FTP/SFTP
Per caricare il file
β‘ cURL (opzionale)
Migliora le prestazioni
π Installazione in 3 Passi
2
Carica sul tuo server
Carica il file nella root del tuo sito web tramite FTP/SFTP o pannello hosting.
π Posizioni corrette:
- β
/public_html/federcreations-crawler.php
- β
/www/federcreations-crawler.php
- β
/htdocs/federcreations-crawler.php
β οΈ Importante: Il file deve essere accessibile pubblicamente all'URL:
https://www.tuosito.com/federcreations-crawler.php
3
Testa l'installazione
Apri nel browser l'URL del tuo crawler con il parametro ?action=info:
https://www.tuosito.com/federcreations-crawler.php?action=info
β
Risposta corretta:
{
"success": true,
"data": {
"name": "FederCreations Sitemap Crawler",
"version": "1.0",
"status": "ready",
"curl_enabled": true,
"php_version": "8.1.0"
}
}
π Perfetto! Se vedi questa risposta, l'installazione Γ¨ riuscita!
π― Come Usare
Opzione 1: Con il Generatore Sitemap
- Vai su FederCreations Sitemap Generator
- Seleziona il metodo di input appropriato
- Inserisci l'URL del tuo crawler quando richiesto
- Avvia la scansione
Opzione 2: Chiamata API Diretta
Puoi chiamare il crawler direttamente via JavaScript:
// Scansiona il sito
fetch('https://www.tuosito.com/federcreations-crawler.php?action=crawl&url=https://www.tuosito.com&depth=3')
.then(res => res.json())
.then(data => {
console.log('URLs trovate:', data.data.urls);
console.log('Totale:', data.data.total);
});
π Parametri API
GET Parameters:
- action - Azione da eseguire (info, crawl, fetch)
- url - URL di partenza (richiesto per crawl e fetch)
- depth - ProfonditΓ massima (1-5, default: 3)
Esempi:
?action=info
?action=crawl&url=https://esempio.com&depth=3
?action=fetch&url=https://esempio.com/pagina.html
π Sicurezza
β
Cosa FA
- Scansiona solo stesso dominio
- Rate limiting integrato
- Timeout automatico
- Nessun DB access
β Cosa NON FA
- Non modifica il sito
- Non accede a file sensibili
- Non esegue codice
- Non memorizza dati
π Raccomandazione: Per maggiore sicurezza, rinomina il file con un nome casuale:
federcreations-crawler.php β il-mio-crawler-XYZ123.php
π Risoluzione Problemi
β Errore 404 - File not found
Causa: Il file non Γ¨ nella posizione corretta.
Soluzione: Verifica che sia nella root del sito web, accessibile pubblicamente.
β "cURL not enabled"
Causa: cURL non Γ¨ abilitato nel tuo hosting.
Soluzione: Il crawler userΓ automaticamente file_get_contents come fallback. Funziona comunque!
β "Failed to fetch URL"
Cause possibili:
- Firewall che blocca richieste localhost
- Timeout troppo breve
- URL non raggiungibile
Soluzione: Contatta il supporto del tuo hosting.
β CORS Error ancora presente
Causa: Il crawler include giΓ gli header CORS corretti.
Soluzione: Verifica che stai chiamando il crawler, non il sito direttamente.
π Supporto
Per problemi o domande:
π Documentazione completa: Consulta il file README-CRAWLER.md per informazioni tecniche avanzate.