Extraer archivos específicos con httrack
Resuelto
Besdu06
-
okuni Mensajes publicados 1325 Estado Miembro -
okuni Mensajes publicados 1325 Estado Miembro -
Hola,
Descargué un software de extracción de sitios web llamado HTTrack. Sin embargo, quisiera capturar solo ciertas páginas del sitio, especificando en la pestaña de opciones el contenido (que es siempre el mismo para las páginas que quiero capturar) de las páginas. Sin embargo, me encuentro con todas las páginas del sitio.
¿Cómo podría corregir eso? ¿Hay otras cosas para modificar en la pestaña de opciones y que no haya hecho?
Gracias por todas sus respuestas!!!!!^^
Besma
Configuración: Windows 7 / Firefox 4.0.1
Descargué un software de extracción de sitios web llamado HTTrack. Sin embargo, quisiera capturar solo ciertas páginas del sitio, especificando en la pestaña de opciones el contenido (que es siempre el mismo para las páginas que quiero capturar) de las páginas. Sin embargo, me encuentro con todas las páginas del sitio.
¿Cómo podría corregir eso? ¿Hay otras cosas para modificar en la pestaña de opciones y que no haya hecho?
Gracias por todas sus respuestas!!!!!^^
Besma
Configuración: Windows 7 / Firefox 4.0.1
4 respuestas
-
No sé si puedes recuperar los nombres de los archivos que quieres descargar.
Me ocurre partir del código fuente de las páginas (mostrado con el navegador), crear la lista de archivos con cualquier editor para luego definirla en WinHttrack (de memoria, debe ser en una casilla Dirección web con la opción Descargar archivos específicos).
Si no, como indica okuni, puedes definir la profundidad máxima, en la pestaña límite.
>>> De pronto tengo una duda, hablas de Httrack, ¿es una versión command line, por qué no usas WinHttrack ?-
-
En mi instalación (que ya tiene bastante tiempo) los dos programas están en la misma carpeta, por lo que se cargaron juntos.
Para ser sincero, nunca había visto que existiera httack.exe.
Todo lo que puedo aconsejarte es que descargues Winhttrack y lo instales.
No es complicado de usar, su configuración se entiende por sí misma. -
ah no sabía ni que había 2 versiones distintas. hablo de Winhttrack
lo mejor para aspirar bien, es revisar todas las opciones y entre otras cosas la cantidad de enlaces de profundidad. en tu caso, solo debes tomar un enlace de profundidad (o 2 porque no sé si el primero que das como referencia cuenta como enlace de profundidad)
luego, en el filtro, indicas que quieres solo archivos .doc, .html u otros, así que :
+*.doc+*.html
creo que eso debería funcionar :p
-
-
hola,
no creo que CCM dé respuestas porque es una herramienta para "piratear" un sitio obteniendo información/contenido.
https://www.commentcamarche.net/faq/307-devenir-pirate-informatique#q=piratage&cur=2&url=%2F
https://www.commentcamarche.net/infos/25921-pourquoi-ccm-n-aide-pas-la-contrefacon-numerique-des-logiciels/
https://www.commentcamarche.net/infos/25845-charte-d-utilisation-de-commentcamarche-net/
--
Si se resuelve, ¡no olvides hacer clic!-
-
Gracias por la información, Nico, pero ya tomé mis precauciones antes de hacer cualquier cosa^^.
La aspiradora del sitio está autorizada en casos donde lo que se aspira no se use con fines comerciales.... En mi caso, el sitio aspirado proporciona documentos que se pueden consultar y descargar legalmente, excepto que debe hacerse documento por documento y cuando hay más de 1500... es un poco largo hacerlos uno por uno.
gracias de nuevo por la información, es bueno saberlo de todos modos -
-
Hola a todos,
Habiendo usado httrack, puedo decirles que esta herramienta no está más destinada a piratear que el hecho de hacer una captura de pantalla o de recurrir a una sesión ftp. Lo que está prohibido es reutilizarlas comercialmente o en un sitio. Los recolectores de Web servían mucho más en la época de conexiones RTC lentas. Permiten recuperar un sitio entero o un tipo de documentos en unos pocos clics. De hecho, es posible recuperar las imágenes de un sitio en la carpeta de imágenes de cada página html, lo que no autoriza más su uso. Hagamos por tanto caso a Besdu06 de querer solo recuperar documentos sin tener que recorrer y guardar cientos de páginas. Es derecho de cada uno archivar y consultar fuera de línea documentos. Internet está hecho para eso. Hay muchos otros medios para que un pirata ejerza sus talentos culpables.
P.S.: mi uso de httrack fue demasiado breve para responder a la petición inicial, pero creo que ellos lo tienen o figuran en foros. Pero creo que es posible porque me parece que tienen filtrado por tipo de archivo.
Atentamente -
-
-
Muy agradable como software :)
cuando creas un proyecto, debes ir a las opciones y luego a configuración de filtrado
Aquí puedes elegir qué tipo de archivo tomas :)
--
El amor es como los espaguetis; cuando está blando, ya está cocido. (proverbio belga)-
-
-
Es simple, para rastrear únicamente las páginas que quieras, en lugar de poner la dirección del sitio
http://www.example.com
pon
http://www.example.com/chien
http://www.example.com/chat
http://www.example.com/poisson
así solo tendrás las subpáginas de esas páginas y no sus otras páginas que hablan, por ejemplo, de comida y juguetes.
entonces, en resumen, solo debes indicar el campo de tu búsqueda. -
-
Efectivamente, he intentado usar el ejemplo de mimigenie pero me toma todas las páginas...
Ahora es interesante la idea del número de enlaces de profundidad, pero es una noción que no domino... ¿Cómo hacerlo?
Le paso el enlace del sitio: http://www.legifrance.gouv.fr/affichSarde.do?reprise=true&fastReqId=817860530&idSarde=SARDOBJT000007104919&page=1
Solo hace falta que recupere todas las aristas (ya sea html, ya sea .doc o .pdf) sobre la producción de electricidad.
Gracias por tu paciencia.^^
-
-
hay opciones para configurar correctamente
no es el único 'aspiradora' existente ...
y si te topas con un sitio que está protegido ???
... al final ¿para qué sirve todo esto???
--
el 'www' también sirve para comunicarse, compartir e intercambiar, ¿no?
gracias por tener la amabilidad de responder a quienes intentan ayudarles-
no no es un sitio protegido, es un sitio desde el cual se pueden descargar documentos libremente, excepto que hay que hacerlo uno por uno y hay más de 1500. Por lo tanto, el objetivo de httrack es poder, únicamente, recuperar estos documentos que están en formato .doc, .pdf o .html.
Gracias por vuestra ayuda ^^
-