Extraer archivos específicos con httrack

Resuelto
Besdu06 -  
okuni Mensajes publicados 1325 Estado Miembro -
Hola,

Descargué un software de extracción de sitios web llamado HTTrack. Sin embargo, quisiera capturar solo ciertas páginas del sitio, especificando en la pestaña de opciones el contenido (que es siempre el mismo para las páginas que quiero capturar) de las páginas. Sin embargo, me encuentro con todas las páginas del sitio.

¿Cómo podría corregir eso? ¿Hay otras cosas para modificar en la pestaña de opciones y que no haya hecho?

Gracias por todas sus respuestas!!!!!^^

Besma

Configuración: Windows 7 / Firefox 4.0.1

4 respuestas

  1. telliak Mensajes publicados 3652 Fecha de registro   Estado Miembro Última intervención   885
     
    No sé si puedes recuperar los nombres de los archivos que quieres descargar.
    Me ocurre partir del código fuente de las páginas (mostrado con el navegador), crear la lista de archivos con cualquier editor para luego definirla en WinHttrack (de memoria, debe ser en una casilla Dirección web con la opción Descargar archivos específicos).
    Si no, como indica okuni, puedes definir la profundidad máxima, en la pestaña límite.
    >>> De pronto tengo una duda, hablas de Httrack, ¿es una versión command line, por qué no usas WinHttrack ?
    1
    1. besdu06
       
      A no conozco WinHTTrack... ¿es más fácil de usar? Si es así, ¿hay que descargarlo?

      Gracias por tu ayuda
      0
    2. telliak Mensajes publicados 3652 Fecha de registro   Estado Miembro Última intervención   885
       
      En mi instalación (que ya tiene bastante tiempo) los dos programas están en la misma carpeta, por lo que se cargaron juntos.
      Para ser sincero, nunca había visto que existiera httack.exe.
      Todo lo que puedo aconsejarte es que descargues Winhttrack y lo instales.
      No es complicado de usar, su configuración se entiende por sí misma.
      0
    3. okuni Mensajes publicados 1325 Estado Miembro 126
       
      ah no sabía ni que había 2 versiones distintas. hablo de Winhttrack
      lo mejor para aspirar bien, es revisar todas las opciones y entre otras cosas la cantidad de enlaces de profundidad. en tu caso, solo debes tomar un enlace de profundidad (o 2 porque no sé si el primero que das como referencia cuenta como enlace de profundidad)
      luego, en el filtro, indicas que quieres solo archivos .doc, .html u otros, así que :
      +*.doc+*.html

      creo que eso debería funcionar :p
      0
  2. Nico_ Mensajes publicados 1220 Fecha de registro   Estado Miembro Última intervención   189
     
    hola,
    no creo que CCM dé respuestas porque es una herramienta para "piratear" un sitio obteniendo información/contenido.
    https://www.commentcamarche.net/faq/307-devenir-pirate-informatique#q=piratage&cur=2&url=%2F
    https://www.commentcamarche.net/infos/25921-pourquoi-ccm-n-aide-pas-la-contrefacon-numerique-des-logiciels/
    https://www.commentcamarche.net/infos/25845-charte-d-utilisation-de-commentcamarche-net/
    --
    Si se resuelve, ¡no olvides hacer clic!
    0
    1. bg62 Mensajes publicados 23433 Fecha de registro   Estado Moderador Última intervención   2 435
       
      no tiene nada que ver con el pirateo!!!
      busca un poco en los trucos o descargas, hay una cantidad de aspiradores de sitios ...
      pero ¿qué valen realmente en la práctica, sobre todo en sitios seguros ???
      0
    2. Besdu06
       
      Gracias por la información, Nico, pero ya tomé mis precauciones antes de hacer cualquier cosa^^.
      La aspiradora del sitio está autorizada en casos donde lo que se aspira no se use con fines comerciales.... En mi caso, el sitio aspirado proporciona documentos que se pueden consultar y descargar legalmente, excepto que debe hacerse documento por documento y cuando hay más de 1500... es un poco largo hacerlos uno por uno.

      gracias de nuevo por la información, es bueno saberlo de todos modos
      0
    3. telliak Mensajes publicados 3652 Fecha de registro   Estado Miembro Última intervención   885
       
      Hackear lo que está libremente accesible? Qué idea tan divertida.
      0
    4. georges97 Mensajes publicados 14615 Fecha de registro   Estado Colaborador Última intervención   2 935
       
      Hola a todos,

      Habiendo usado httrack, puedo decirles que esta herramienta no está más destinada a piratear que el hecho de hacer una captura de pantalla o de recurrir a una sesión ftp. Lo que está prohibido es reutilizarlas comercialmente o en un sitio. Los recolectores de Web servían mucho más en la época de conexiones RTC lentas. Permiten recuperar un sitio entero o un tipo de documentos en unos pocos clics. De hecho, es posible recuperar las imágenes de un sitio en la carpeta de imágenes de cada página html, lo que no autoriza más su uso. Hagamos por tanto caso a Besdu06 de querer solo recuperar documentos sin tener que recorrer y guardar cientos de páginas. Es derecho de cada uno archivar y consultar fuera de línea documentos. Internet está hecho para eso. Hay muchos otros medios para que un pirata ejerza sus talentos culpables.

      P.S.: mi uso de httrack fue demasiado breve para responder a la petición inicial, pero creo que ellos lo tienen o figuran en foros. Pero creo que es posible porque me parece que tienen filtrado por tipo de archivo.

      Atentamente
      0
    5. okuni Mensajes publicados 1325 Estado Miembro 126
       
      Aspirar un sitio no tiene nada de ilegal. gracias de saber de qué hablamos antes de hablar ;)
      0
  3. okuni Mensajes publicados 1325 Estado Miembro 126
     
    Muy agradable como software :)
    cuando creas un proyecto, debes ir a las opciones y luego a configuración de filtrado
    Aquí puedes elegir qué tipo de archivo tomas :)
    --
    El amor es como los espaguetis; cuando está blando, ya está cocido. (proverbio belga)
    0
    1. Besdu06
       
      Ya lo he intentado, pero me roba todas las demás páginas que no necesito. ¿Qué hago?
      Gracias por tu respuesta
      0
    2. okuni Mensajes publicados 1325 Estado Miembro 126
       
      dime lo que escribiste en el campo del filtro.
      0
    3. mimigenie Mensajes publicados 1180 Fecha de registro   Estado Miembro Última intervención   314
       
      Es simple, para rastrear únicamente las páginas que quieras, en lugar de poner la dirección del sitio

      http://www.example.com

      pon

      http://www.example.com/chien
      http://www.example.com/chat
      http://www.example.com/poisson

      así solo tendrás las subpáginas de esas páginas y no sus otras páginas que hablan, por ejemplo, de comida y juguetes.


      entonces, en resumen, solo debes indicar el campo de tu búsqueda.
      0
    4. okuni Mensajes publicados 1325 Estado Miembro 126
       
      Todo depende del número de enlaces de profundidad (también configurable).
      0
    5. besdu06
       
      Efectivamente, he intentado usar el ejemplo de mimigenie pero me toma todas las páginas...
      Ahora es interesante la idea del número de enlaces de profundidad, pero es una noción que no domino... ¿Cómo hacerlo?
      Le paso el enlace del sitio: http://www.legifrance.gouv.fr/affichSarde.do?reprise=true&fastReqId=817860530&idSarde=SARDOBJT000007104919&page=1

      Solo hace falta que recupere todas las aristas (ya sea html, ya sea .doc o .pdf) sobre la producción de electricidad.

      Gracias por tu paciencia.^^
      0
  4. bg62 Mensajes publicados 23433 Fecha de registro   Estado Moderador Última intervención   2 435
     
    hay opciones para configurar correctamente
    no es el único 'aspiradora' existente ...
    y si te topas con un sitio que está protegido ???
    ... al final ¿para qué sirve todo esto???
    --
    el 'www' también sirve para comunicarse, compartir e intercambiar, ¿no?
    gracias por tener la amabilidad de responder a quienes intentan ayudarles
    -1
    1. Besdu06
       
      no no es un sitio protegido, es un sitio desde el cual se pueden descargar documentos libremente, excepto que hay que hacerlo uno por uno y hay más de 1500. Por lo tanto, el objetivo de httrack es poder, únicamente, recuperar estos documentos que están en formato .doc, .pdf o .html.

      Gracias por vuestra ayuda ^^
      0