[java] Parser du html/sgml

Fermé
Ban - 12 mai 2006 à 10:11
 Pseudo - 21 avril 2011 à 12:41
Bonjour,

Dans le cadre d'un projet j'ai à concevoir un parser de documents html ainsi qu'sgml.
Si vous avez quelques codes je serais heureux d'en prendre connaissance ^^

Merci beaucoup.
A voir également:

5 réponses

svp, le moindre renseignement pourrai m'être utile... J'ai fait un parseur basic qui parcours le fichier séquentiellement en supprimant les balises et je me demandais si je ne pouvais pas trouver un moyen moins détourné.

ma méthode pour le moment :
J'utilise un compteur "chevron" que j'incrémente quand je tombe sur un chevron ouvrant et je décrémente quand je tombe sur un fermant. Je parcours les caractères un à un et tant que le compteur est différent de 0 je ne copie pas le caractère.
Je ne pense pas que ce soit une bonne méthode, mais je n'ai pas l'idée d'une autre.

Merci d'avance :)
0
sebsauvage Messages postés 32893 Date d'inscription mercredi 29 août 2001 Statut Modérateur Dernière intervention 21 octobre 2019 15 657
12 mai 2006 à 16:50
Pourquoi réinventer la roue ?

https://java-source.net/open-source/html-parsers
0
C'est sympa ! Merci... Mais je n'ai pas trouvé de sources, et quand je vais dans 'Java HTML Parser' je tombe sur un lien mort. :(
0
sebsauvage Messages postés 32893 Date d'inscription mercredi 29 août 2001 Statut Modérateur Dernière intervention 21 octobre 2019 15 657
15 mai 2006 à 09:48
ah... bon, mauvais site, alors.

Là je n'ai pas le temps (et je ne fais pas de Java ces temps-ci), mais en cherchant sur Google tu devrait en trouver.

SAX et DOM sont parmis les plus courants, mais parfois on gagne à utiliser des librairies plus petites (surtout si c'est pour parser du HTML foireux qu'on peut trouver sur internet).
0
Ok, je n'ai pas encore trouvé mais je vais continuer à chercher.
Merci.
0

Vous n’avez pas trouvé la réponse que vous recherchez ?

Posez votre question
J'ai trouvé celui ci :
http://www.eteks.com/tips/tip6.html


Mais étrangement peu importe l'url du fichier html que je mets en parametre ça ne marche pas... Si quelqu'un pouvait tester ce programme ça serait sympa. Merci.

import java.io.*;
import java.net.*;
import java.util.*;
import javax.swing.text.*;
import javax.swing.text.html.*;
 
// Classe dérivée de HTMLDocument pour permettre de spécifier
// un reader différent dans la méthode getReader ()
public class HTMLDocumentLinks extends HTMLDocument
{
  // Ensemble des ancres de ce fichier HTML
  private Vector anchors = new Vector ();
  // Ensemble des liens URLs trouvés dans ce fichier 
  private Vector urls    = new Vector ();
  // Ensemble des URLs mal écrites dans ce fichier
  private Vector malformedURLs = new Vector ();
 
  // Constructeur
  public HTMLDocumentLinks (URL file)
  {
    // Mémorisation de la base du fichier HTML
    setBase (file);
  }
 
  public final Vector getAnchors ()
  {
    return anchors;
  }
 
  public final Vector getURLs ()
  {
    return urls;
  }
 
  public final Vector getMalformedURLs ()
  {
    return malformedURLs;
  }
 
  private void addAnchor (String anchor)
  {
    // Ajout de l'ancre à l'ensemble des ancres
    anchors.addElement (anchor);
  }
 
  private boolean ignoreURL (String urlString)
  {
    // Ajout uniquement des URLs relatives à ce fichier
    // (les fichiers sans protocole défini avec ':').
    // Eventuellement vous pouvez filtrer différemment les
    // URLs (pas de cgi par exemple,...)
    return urlString.indexOf (':') >= 0;
  }
 
  private void addURL (String urlString)
  {
    if (!ignoreURL (urlString))
      try
      {
        // Fabrication de l'URL relative à ce fichier
        // pour l'ajouter à l'ensemble des URLs qu'il référence
        URL url = new URL (getBase (), urlString);
        // Sous Java 1.2.1, bug sur la construction des URLs
        // si urlString commence par # avec le protocole file 
        // => construction differente de l'URL dans ce cas
        if (urlString.startsWith ("#"))
          url = new URL (getBase ().toString () + urlString);
 
        if (!urls.contains (url))
          urls.addElement (url);
      }
      catch (MalformedURLException e)
      {
        malformedURLs.addElement (urlString);
      }
  }
 
  // Méthode outrepassée pour fournir un reader différent
  public HTMLEditorKit.ParserCallback getReader (int pos)
  {
    return new LinkReader ();
  }
 
  // Les méthodes de cette classe sont rappelées par
  // le parser HTML suivant les différents tag HTML lus.
  // Ici, le but recherché est de garder une trace de tous
  // les tags qui font appels à des URLs (fichiers HTML, images,...).
  private class LinkReader extends HTMLEditorKit.ParserCallback
  {
    // Méthode appelée quand un tag de début est rencontré
    public void handleStartTag (HTML.Tag tag, MutableAttributeSet att, int pos)
    {
      String attribute;
      if (tag.equals (HTML.Tag.A))  // Tags <A NAME=...> ou <A HREF=...>
      {
        attribute = (String)att.getAttribute (HTML.Attribute.NAME);
        if (attribute != null)
          addAnchor (attribute);
        else
        { 
          attribute = (String)att.getAttribute (HTML.Attribute.HREF);
          if (attribute != null)
            addURL (attribute);
        }
      }
      else if (tag.equals (HTML.Tag.APPLET))  // Tag <APPLET CODE=...>
      {
        attribute = (String)att.getAttribute (HTML.Attribute.CODE);
        if (attribute != null)
        {
          String archive = (String)att.getAttribute (HTML.Attribute.ARCHIVE);
          if (archive != null)
            // Branchement sur le fichier d'archive s'il existe
            attribute = archive;
          else
            if (!attribute.endsWith (".class"))
              attribute += ".class";
 
          // Recherche du répertoire éventuel relatif à l'applet
          String codebase = (String)att.getAttribute (HTML.Attribute.CODEBASE);
          if (codebase != null)
            if (codebase.endsWith ("/"))
              attribute = codebase + attribute;
            else
              attribute = codebase + '/' + attribute;
          addURL (attribute);
        }
      }
      else if (   tag.equals (HTML.Tag.BODY)  // Tag <BODY BACKGROUND=...>
               || tag.equals (HTML.Tag.TABLE) // Tag <TABLE BACKGROUND=...>
               || tag.equals (HTML.Tag.TR)    // Tag <TR BACKGROUND=...>
               || tag.equals (HTML.Tag.TD))   // Tag <TD BACKGROUND=...>
      {
        attribute = (String)att.getAttribute (HTML.Attribute.BACKGROUND);
        if (attribute != null)
          addURL (attribute);
      }
    }
 
    // Méthode appelée quand un tag simple est lu
    public void handleSimpleTag (HTML.Tag tag, MutableAttributeSet att, int pos)
    {
      String    attribute;
      if (   tag.equals (HTML.Tag.FRAME) // Tag <FRAME SRC=...>
          || tag.equals (HTML.Tag.IMG))  // Tag <IMG SRC=...>
      {
        attribute = (String)att.getAttribute (HTML.Attribute.SRC);
        if (attribute != null)
          addURL (attribute);
      }
      else if (tag.equals (HTML.Tag.AREA)) // Tag <AREA HREF=...>
      {
        attribute = (String)att.getAttribute (HTML.Attribute.HREF);
        if (attribute != null)
          addURL (attribute);
      }
    }
 
    // HTMLEditorKit.ParserCallback définit aussi d'autres méthodes
    // qu'il est inutile d'outrepasser ici (tag de fin, commentaires, 
    // corps de texte,...)
  }
 
  // Méthode main () d'exemple de mise en oeuvre, prend en argument 
  // un nom de fichier HTML sous forme d'URL, par exemple :
  // java HTMLDocumentLinks file:/disk/dir1/index.html
  public static void main (String args [])
  {
    try
    {
      // Ouverture du fichier contenu dans l'argument 0
      URL    fileURL = new URL (args [0]);
      Reader urlReader = new BufferedReader (
                           new InputStreamReader (fileURL.openStream ()));
 
      // Création d'une instance de parser
      HTMLDocumentLinks doc = new HTMLDocumentLinks (fileURL);
 
      // Parsing du fichier HTML avec Swing
      new HTMLEditorKit ().read (urlReader, doc, 0);
      urlReader.close ();
 
      // Listing des ancres et des URLs trouvées dans le fichier
      System.out.println ("Liste des ancres :");
      for (Enumeration e = doc.getAnchors ().elements ();
           e.hasMoreElements (); )
        System.out.println (e.nextElement ());
 
      System.out.println ("\nListe des URLs :");
      for (Enumeration e = doc.getURLs ().elements ();
           e.hasMoreElements (); )
        System.out.println (e.nextElement ());
    }
    catch (IOException e)
    {
      System.out.println ("Probleme d'acces a l'URL : " + args [0]);
    }
    catch (BadLocationException e)
    { }
  }
}
-1
c'est un vieux poste, mais juste au cas ou quelqu'un d'autre voudrai utiliser se petit soft..

pour un usage locale, il faut doubler // \\

ex: file:////c:\\test.html

"file:// designe le protocole utilisé comme http:// ou ftp://"
puis indiquer le chemin d'acces qui dans mon exemple est c:\test.html

voilou j'espere que sa vous sera utile...

desolee pour les fautes d'ortograph.Lol
0