Aller au contenu
NewKitApp

Rechercher des outils

Accédez à n’importe quel outil par son nom

Website to JSON

Extrayez un document JSON propre de n'importe quelle page web — ses métadonnées, ses titres et les statistiques de contenu.

Qu’est-ce que Website to JSON ?

Website to JSON lit n'importe quelle page web publique et renvoie un seul document JSON proprement structuré qui la décrit. Au lieu de vider du HTML brut et de vous laisser analyser les balises, il vous remet un objet prêt à l'emploi avec l'identité de la page — titre, description, URL, nom du site, auteur et horodatage de publication — ainsi que des statistiques de contenu dérivées comme le nombre de mots, le temps de lecture estimé, et les décomptes de titres, liens, images et blocs de code. Il extrait aussi le plan des titres de la page et un court extrait en prose. La conversion est déterministe : aucun modèle d'IA dans la boucle, donc la même URL produit toujours le même JSON, et comme la récupération s'exécute côté serveur le résultat est identique que vous le lisiez dans le navigateur ou que vous l'envoyiez dans un script.

Comment utiliser Website to JSON

  1. Collez l'URL complète de la page à extraire (par exemple, https://example.com/blog/post).
  2. Cliquez sur « Extract » — la page est récupérée et analysée sur le serveur, sans extension ni connexion requise.
  3. Examinez le JSON formaté dans le panneau de sortie ; il est pretty-printé pour pouvoir le lire d'un coup d'œil.
  4. Copiez le JSON dans votre presse-papiers, ou téléchargez-le comme fichier .json à utiliser hors ligne.
  5. Fournissez le fichier téléchargé à un script, notebook ou pipeline qui attend des données de page structurées.

Exemples

Article de blog

Entrée : https://example.com/blog/how-we-shipped-it

Sortie : { "url": "https://example.com/blog/how-we-shipped-it", "title": "Comment nous l'avons livré", "description": "Un regard dans les coulisses du lancement.", "siteName": "Example", "author": "Jane Doe", "publishedTime": "2025-03-14T09:00:00Z", "stats": { "wordCount": 1240, "readingTimeMinutes": 6, "headingCount": 8, "linkCount": 23, "imageCount": 4, "codeBlockCount": 2 }, "headings": ["Comment nous l'avons livré", "Le problème", "La construction", "Le lancement"], "excerpt": "Nous avions six semaines, trois ingénieurs et une date limite impérative…" }

Page de documentation

Entrée : https://docs.example.com/api/authentication

Sortie : { "url": "https://docs.example.com/api/authentication", "title": "Authentification", "description": "Comment authentifier les requêtes API.", "siteName": "Example Docs", "author": null, "publishedTime": null, "stats": { "wordCount": 642, "readingTimeMinutes": 3, "headingCount": 5, "linkCount": 11, "imageCount": 0, "codeBlockCount": 6 }, "headings": ["Authentification", "Clés API", "OAuth 2.0", "Limites de débit"], "excerpt": "Toutes les requêtes API doivent être authentifiées…" }

Erreurs courantes

  • S'attendre à voir apparaître le contenu rendu par JavaScript — les pages qui construisent leur DOM côté client après le chargement peuvent revenir avec des champs clairsemés ou vides ; privilégiez les URL rendues côté serveur.
  • Considérer un auteur manquant ou un publishedTime comme un bug — la plupart des sites ne publient simplement pas ces balises de métadonnées, et l'outil signale null honnêtement plutôt que d'inventer une valeur.
  • Supposer que l'extrait est l'article complet — c'est un court fragment d'introduction dérivé du texte lisible ; utilisez les titres et les statistiques pour comprendre la page entière.
  • Coller une URL qui redirige vers une connexion ou un écran de consentement et s'attendre au contenu public — le récupérateur suit les redirections mais ne peut pas accepter les cookies ni franchir les murs.

Pourquoi utiliser cet outil

  • Un clic vers un objet JSON typé propre — plus d'analyse HTML ni de bricolage de sélecteurs de votre côté.
  • Déterministe et sans IA, donc les résultats sont reproductibles et ne coûtent rien par requête.
  • La récupération côté serveur signifie une sortie identique dans le navigateur et depuis un script ou un cron.
  • Copie dans le presse-papiers ou téléchargement comme fichier .json pour un usage hors ligne dans les pipelines et notebooks.

Questions fréquentes