{"id":69495,"date":"2022-10-05T22:19:25","date_gmt":"2022-10-05T20:19:25","guid":{"rendered":"https:\/\/rmarketingdigital.com\/wiki\/headless-crawling\/"},"modified":"2024-10-28T22:38:32","modified_gmt":"2024-10-28T21:38:32","slug":"ramper-sans-tete","status":"publish","type":"glossary","link":"https:\/\/rmarketingdigital.com\/fr\/wiki\/ramper-sans-tete\/","title":{"rendered":"Ramper sans t\u00eate"},"content":{"rendered":"<p><\/p>\n<div id=\"mw-content-text\" lang=\"es\" dir=\"ltr\" class=\"mw-content-ltr\">\n<p>El <b>headless crawling<\/b> es la navegaci\u00f3n automatizada de Internet y dominios individuales usando un navegador headless (sin cabeza), que es un navegador web <b>sin interfaz gr\u00e1fica de usuario<\/b>. El headless crawling incluye muchos enfoques y m\u00e9todos para extraer, almacenar, repasar y procesar datos. Los sitios web, las apps web y las caracter\u00edsticas individuales de las webs adem\u00e1s pueden probarse y comprobarse autom\u00e1ticamente. El headless crawling incluye superposiciones tem\u00e1ticas con temas como la recuperaci\u00f3n de informaci\u00f3n, data mining, el scraping y la automatizaci\u00f3n de pruebas.\n<\/p>\n<h2>\n<span class=\"mw-headline\" id=\"Informaci.C3.B3n_general\">Informaci\u00f3n general<\/span><br \/>\n<\/h2>\n<p>Hasta hace poco,  Google recomendaba el uso de navegadores headless para rastrear webs  din\u00e1micas. Los operadores ten\u00edan que proporcionar una captura de pantalla HTML de su portal web, para que Google pudiera leer y examinar el contenido de la misma. El llamado esquema de rastreo\/crawl AJAX ha quedado obsoleto y ya no se usa. En cambio, el contenido de la web se proporciona independientemente de la tecnolog\u00eda utilizada, incluyendo el dispositivo, el navegador y la conexi\u00f3n a Internet, lo que se conoce como mejora progresiva <sup id=\"cite_ref-1\" class=\"reference\">[1]<\/sup>. El headless crawling es esencialmente una parte de cualquier motor de b\u00fasqueda. El contenido de la Web se navega, pero no se renderiza o muestra al usuario de forma gr\u00e1fica.\n<\/p>\n<p>Lo que sucede con los datos detectados, es una cuesti\u00f3n de enfoque. No obstante, se supone que el motor de b\u00fasqueda de Google usa la capacidad de headless crawling desde 2004 y JavaScript ya no es un obst\u00e1culo desde octubre de 2015. Los motores de b\u00fasqueda pueden utilizar headless crawling para examinar sitios web. En la medida en que el crawler simula una llamada a un portal web con una interfaz no gr\u00e1fica, los motores de b\u00fasqueda pueden sacar conclusiones de esta informaci\u00f3n y calificar los sitios web en funci\u00f3n de su comportamiento en el navegador headless <sup id=\"cite_ref-2\" class=\"reference\">[2]<\/sup>.\n<\/p>\n<h2>\n<span class=\"mw-headline\" id=\"C.C3.B3mo_funciona\">C\u00f3mo funciona<\/span><br \/>\n<\/h2>\n<p>En el centro del headless crawling se encuentra el <b>navegador headless<\/b>, un programa que lee el contenido web, lo pasa a otros programas o lo muestra basado en texto en forma de archivos, listas y matrices. Este tipo de navegadores obtienen acceso a los sitios web por medio de su implementaci\u00f3n en una infraestructura de servidor. Opcionalmente, se puede usar un servidor virtual o un servidor proxy. Desde all\u00ed, el navegador headless intenta tener acceso a una URL; \u00e9ste es el punto de partida del procedimiento de crawling, que se inicia con una l\u00ednea de comandos o un comando de script <sup id=\"cite_ref-3\" class=\"reference\">[3]<\/sup>. Dependiendo de la configuraci\u00f3n, el navegador puede hallar m\u00e1s URLs. Los contenidos almacenados all\u00ed pueden ser procesados, inclusive la cuesti\u00f3n de las posiciones de link en el portal web es factible. No obstante, una interfaz API, que transfiere los datos al programa de tratamiento, es frecuentemente necesaria para este prop\u00f3sito.\n<\/p>\n<p>Lo que hace que el headless crawling sea especial es la comunicaci\u00f3n m\u00e1quina a m\u00e1quina (M2M). Tanto las URLs llamadas como el contenido web encontrado no se muestra al usuario final, como en el caso de los navegadores convencionales. En su lugar, el navegador headless reenv\u00eda los datos recuperados en formatos que deben definirse de antemano, pero que pueden procesarse autom\u00e1ticamente m\u00e1s tarde. Si se implementa de forma extensiva, un navegador headless puede manejar distintos lenguajes de programaci\u00f3n, scripts y procesos gracias a una API que puede comunicarse con otros programas o infraestructuras por medio de de peticiones HTTP o TCP. Este principio se usa frecuentemente para extraer <b>grandes cantidades de datos<\/b>, lo que en \u00faltima instancia plantea la cuesti\u00f3n de hasta qu\u00e9 punto es legal compilar y procesar dichos datos. En principio, los derechos de autor, los acuerdos de privacidad y la privacidad de los usuarios podr\u00edan ser violados <sup id=\"cite_ref-4\" class=\"reference\">[4]<\/sup>. Lo mismo se aplica a los portales de comparaci\u00f3n de precios, motores de b\u00fasqueda y proveedores de meta-b\u00fasqueda.\n<\/p>\n<h2>\n<span class=\"mw-headline\" id=\"Relevancia_pr.C3.A1ctica\">Relevancia pr\u00e1ctica<\/span><br \/>\n<\/h2>\n<p>El headless crawling no s\u00f3lo se aplica en los motores de b\u00fasqueda, sino adem\u00e1s en otros casos de uso. Dos ejemplos:\n<\/p>\n<ul>\n<li> <b>Automatizaci\u00f3n de pruebas<\/b>: La prueba\/test de sitios web, items de sitios web y funciones es un uso com\u00fan del headless crawling. Por ende, los enlaces rotos, los redireccionamientos, los items interactivos, los componentes individuales (unidades) y los m\u00f3dulos pueden ser comprobados en cuanto a su funci\u00f3n. Se pueden probar las caracter\u00edsticas de rendimiento y la generaci\u00f3n de contenido de sitios web a partir de bases de datos. Con una implementaci\u00f3n extensiva, los sitios web pueden ser probados de forma relativamente completa y, fundamentalmente, automatizados. De esta manera, los escenarios de prueba que usan el headless crawling van mucho m\u00e1s all\u00e1 del mero test de un sistema en t\u00e9rminos de ca\u00eddas, errores del sistema y comportamiento no deseado. Los tests con headless crawling son similares a las pruebas de aceptaci\u00f3n porque el navegador headless puede simular el comportamiento de los sitios web desde la perspectiva del usuario y, por ejemplo, los enlaces de clic <sup id=\"cite_ref-5\" class=\"reference\">[5]<\/sup>. No obstante, se requieren profundos conocimientos de programaci\u00f3n y scripting para este escenario. Ya que las pruebas se realizan a petici\u00f3n del cliente o con un objeto de prueba elegido cuyos derechos pertenecen al propietario del sitio, la automatizaci\u00f3n de pruebas con headless crawling no suele ser objetable. Los navegadores headless conocidos con framework (API, soporte de lenguajes de programaci\u00f3n o manejo de DOM) son Selenium, PhatnomJS o HtmlUnit. Por lo general, los navegadores headless usan un motor de dise\u00f1o, que adem\u00e1s est\u00e1 integrado en los navegadores convencionales y en los rastreadores de los motores de b\u00fasqueda. Ejemplos de motores de dise\u00f1o son Webkit, Gecko o Trident.<\/li>\n<\/ul>\n<ul>\n<li> <b>Web Scraping<\/b>: El scraping es una t\u00e9cnica de crawling, en la que se extraen los datos y se agregan para su uso posterior. A veces se recopilan, leen y procesan grandes cantidades de datos de una o m\u00e1s fuentes. El scraping puede ser perjudicial y se clasifica como tecnolog\u00eda de  black-hat o cracker en muchos escenarios de uso. Los ataques de denegaci\u00f3n de servicio (denial of service, DoS) y denegaci\u00f3n de servicio distribuida (DDoS) usan el principio de headless crawling para tener acceso a un portal web o aplicaci\u00f3n web <sup id=\"cite_ref-6\" class=\"reference\">[6]<\/sup>. Usualmente se usan algunos m\u00e9todos ilegales, por ejemplo, para esconder la direcci\u00f3n IP (IP spoofing) para distraer del ataque real a la red o infiltrar la comunicaci\u00f3n entre el servidor y varios clientes por medio de de TCP (hijacking).<\/li>\n<\/ul>\n<h2>\n<span class=\"mw-headline\" id=\"Relevancia_para_la_optimizaci.C3.B3n_de_motores_de_b.C3.BAsqueda\">Relevancia para la optimizaci\u00f3n de motores de b\u00fasqueda<\/span><br \/>\n<\/h2>\n<p>El headless crawling es un aspecto importante de SEO. Como ya se ha mencionado, el principio es (muy probablemente) utilizado por varios motores de b\u00fasqueda para rastrear sitios web y apps web, inclusive si el esquema de crawl AJAX est\u00e1 obsoleto. Google recomienda en distintos puntos de las Directrices de calidad usar un navegador basado en texto, como Lynx, para representar los sitios web tal y como los ve Google. Se puede asumir que la capacidad de Google y de otros motores de b\u00fasqueda puede hacer mucho m\u00e1s que los navegadores basados en texto y lo que se comunica oficialmente. Por consiguiente, tendr\u00eda sentido aprender headless crawling en detalle. Porque con este principio, los sitios web pueden ser probados a fondo y con esta perspectiva los SEOs pueden aventurarse a mirar detr\u00e1s de las escenas del operador del motor de b\u00fasqueda, sin renunciar de vista a los usuarios.\n<\/p>\n<h2>\n<\/h2>\n<h2>\n<span class=\"mw-headline\" id=\"Enlaces_Web\">Enlaces Web<\/span><br \/>\n<\/h2>\n<ul>\n<li> <a rel=\"nofollow noopener noreferrer\" target=\"_blank\" class=\"external text\" href=\"http:\/\/internetofthingsagenda.techtarget.com\/definition\/headless-system\">Definici\u00f3n de Headless Browser<\/a>\n<\/li>\n<li> <a rel=\"nofollow noopener noreferrer\" target=\"_blank\" class=\"external text\" href=\"http:\/\/blog.arhg.net\/2009\/10\/what-is-headless-browser.html\">\u00bfQu\u00e9 es un headless browser?<\/a>\n<\/li>\n<\/ul>\n<p><!-- \nNewPP limit report\nCached time: 20200501180810\nCache expiry: 86400\nDynamic content: false\nCPU time usage: 0.012 seconds\nReal time usage: 0.013 seconds\nPreprocessor visited node count: 115\/1000000\nPreprocessor generated node count: 238\/1000000\nPost\u2010expand include size: 0\/2097152 bytes\nTemplate argument size: 0\/2097152 bytes\nHighest expansion depth: 2\/40\nExpensive parser function count: 0\/100\n--><!-- \nTransclusion expansion time report (%,ms,calls,template)\n100.00%    0.000      1 - -total\n--><!-- Saved in parser cache with key es_:stable-pcache:idhash:293-0!*!0!!es!*!* and timestamp 20200501180810 and revision id 2400\n -->\n<\/div>\n","protected":false},"excerpt":{"rendered":"<p>El headless crawling es la navegaci\u00f3n automatizada de Internet y dominios individuales usando un navegador headless (sin cabeza), que es un navegador web sin interfaz gr\u00e1fica de usuario. El headless&#8230;<\/p>","protected":false},"author":1,"featured_media":0,"parent":0,"template":"","glossary-cat":[],"class_list":["post-69495","glossary","type-glossary","status-publish"],"yoast_head":"<!-- This site is optimized with the Yoast SEO Premium plugin v27.0 (Yoast SEO v28.2) - https:\/\/yoast.com\/product\/yoast-seo-premium-wordpress\/ -->\n<title>Headless Crawling - R Marketing Digital<\/title>\n<meta name=\"robots\" content=\"index, follow, max-snippet:-1, max-image-preview:large, max-video-preview:-1\" \/>\n<link rel=\"canonical\" href=\"https:\/\/rmarketingdigital.com\/fr\/wiki\/ramper-sans-tete\/\" \/>\n<meta property=\"og:locale\" content=\"fr_FR\" \/>\n<meta property=\"og:type\" content=\"article\" \/>\n<meta property=\"og:title\" content=\"Headless Crawling\" \/>\n<meta property=\"og:description\" content=\"El headless crawling es la navegaci\u00f3n automatizada de Internet y dominios individuales usando un navegador headless (sin cabeza), que es un navegador web sin interfaz gr\u00e1fica de usuario. El headless...\" \/>\n<meta property=\"og:url\" content=\"https:\/\/rmarketingdigital.com\/fr\/wiki\/ramper-sans-tete\/\" \/>\n<meta property=\"og:site_name\" content=\"R Marketing Digital\" \/>\n<meta property=\"article:modified_time\" content=\"2024-10-28T21:38:32+00:00\" \/>\n<meta name=\"twitter:card\" content=\"summary_large_image\" \/>\n<script type=\"application\/ld+json\" class=\"yoast-schema-graph\">{\"@context\":\"https:\\\/\\\/schema.org\",\"@graph\":[{\"@type\":\"WebPage\",\"@id\":\"https:\\\/\\\/rmarketingdigital.com\\\/wiki\\\/headless-crawling\\\/\",\"url\":\"https:\\\/\\\/rmarketingdigital.com\\\/wiki\\\/headless-crawling\\\/\",\"name\":\"Headless Crawling - R Marketing Digital\",\"isPartOf\":{\"@id\":\"https:\\\/\\\/rmarketingdigital.com\\\/#website\"},\"datePublished\":\"2022-10-05T20:19:25+00:00\",\"dateModified\":\"2024-10-28T21:38:32+00:00\",\"inLanguage\":\"fr-FR\",\"potentialAction\":[{\"@type\":\"ReadAction\",\"target\":[\"https:\\\/\\\/rmarketingdigital.com\\\/wiki\\\/headless-crawling\\\/\"]}]},{\"@type\":\"WebSite\",\"@id\":\"https:\\\/\\\/rmarketingdigital.com\\\/#website\",\"url\":\"https:\\\/\\\/rmarketingdigital.com\\\/\",\"name\":\"R Marketing Digital\",\"description\":\"Agencia SEO | Publicidad redes sociales | Community Management\",\"potentialAction\":[{\"@type\":\"SearchAction\",\"target\":{\"@type\":\"EntryPoint\",\"urlTemplate\":\"https:\\\/\\\/rmarketingdigital.com\\\/?s={search_term_string}\"},\"query-input\":{\"@type\":\"PropertyValueSpecification\",\"valueRequired\":true,\"valueName\":\"search_term_string\"}}],\"inLanguage\":\"fr-FR\"}]}<\/script>\n<!-- \/ Yoast SEO Premium plugin. -->","yoast_head_json":{"title":"Headless Crawling - R Marketing Digital","robots":{"index":"index","follow":"follow","max-snippet":"max-snippet:-1","max-image-preview":"max-image-preview:large","max-video-preview":"max-video-preview:-1"},"canonical":"https:\/\/rmarketingdigital.com\/fr\/wiki\/ramper-sans-tete\/","og_locale":"fr_FR","og_type":"article","og_title":"Headless Crawling","og_description":"El headless crawling es la navegaci\u00f3n automatizada de Internet y dominios individuales usando un navegador headless (sin cabeza), que es un navegador web sin interfaz gr\u00e1fica de usuario. El headless...","og_url":"https:\/\/rmarketingdigital.com\/fr\/wiki\/ramper-sans-tete\/","og_site_name":"R Marketing Digital","article_modified_time":"2024-10-28T21:38:32+00:00","twitter_card":"summary_large_image","schema":{"@context":"https:\/\/schema.org","@graph":[{"@type":"WebPage","@id":"https:\/\/rmarketingdigital.com\/wiki\/headless-crawling\/","url":"https:\/\/rmarketingdigital.com\/wiki\/headless-crawling\/","name":"Headless Crawling - R Marketing Digital","isPartOf":{"@id":"https:\/\/rmarketingdigital.com\/#website"},"datePublished":"2022-10-05T20:19:25+00:00","dateModified":"2024-10-28T21:38:32+00:00","inLanguage":"fr-FR","potentialAction":[{"@type":"ReadAction","target":["https:\/\/rmarketingdigital.com\/wiki\/headless-crawling\/"]}]},{"@type":"WebSite","@id":"https:\/\/rmarketingdigital.com\/#website","url":"https:\/\/rmarketingdigital.com\/","name":"Marketing num\u00e9rique","description":"Agence de r\u00e9f\u00e9rencement | Publicit\u00e9 sur les r\u00e9seaux sociaux | Gestion de communaut\u00e9","potentialAction":[{"@type":"SearchAction","target":{"@type":"EntryPoint","urlTemplate":"https:\/\/rmarketingdigital.com\/?s={search_term_string}"},"query-input":{"@type":"PropertyValueSpecification","valueRequired":true,"valueName":"search_term_string"}}],"inLanguage":"fr-FR"}]}},"_links":{"self":[{"href":"https:\/\/rmarketingdigital.com\/fr\/wp-json\/wp\/v2\/glossary\/69495","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/rmarketingdigital.com\/fr\/wp-json\/wp\/v2\/glossary"}],"about":[{"href":"https:\/\/rmarketingdigital.com\/fr\/wp-json\/wp\/v2\/types\/glossary"}],"author":[{"embeddable":true,"href":"https:\/\/rmarketingdigital.com\/fr\/wp-json\/wp\/v2\/users\/1"}],"version-history":[{"count":0,"href":"https:\/\/rmarketingdigital.com\/fr\/wp-json\/wp\/v2\/glossary\/69495\/revisions"}],"wp:attachment":[{"href":"https:\/\/rmarketingdigital.com\/fr\/wp-json\/wp\/v2\/media?parent=69495"}],"wp:term":[{"taxonomy":"glossary-cat","embeddable":true,"href":"https:\/\/rmarketingdigital.com\/fr\/wp-json\/wp\/v2\/glossary-cat?post=69495"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}