{"id":69489,"date":"2022-06-10T02:36:01","date_gmt":"2022-06-10T00:36:01","guid":{"rendered":"https:\/\/rmarketingdigital.com\/wiki\/googlebot-2\/"},"modified":"2024-10-28T22:51:17","modified_gmt":"2024-10-28T21:51:17","slug":"googlebot","status":"publish","type":"glossary","link":"https:\/\/rmarketingdigital.com\/en\/wiki\/googlebot\/","title":{"rendered":"Googlebot"},"content":{"rendered":"<p><\/p>\n<div id=\"mw-content-text\" lang=\"es\" dir=\"ltr\" class=\"mw-content-ltr\">\n<p><b>Googlebot<\/b> es el crawler de Google, que recopila documentos de Internet y los entrega m\u00e1s tarde para la b\u00fasqueda de Google. Recopila documentos por medio de de un procedimiento automatizado, que funciona de forma muy parecida a un navegador web. El bot env\u00eda una petici\u00f3n y recibe una respuesta de un servidor.\n<\/p>\n<p>Si ciertos par\u00e1metros permiten el acceso al Googlebot, \u00e9ste sube una sola p\u00e1gina web, a la que se puede entrar por medio de de una URL y la almacena inicialmente en el \u00edndice de Google. As\u00ed es como Googlebot rastrea el Internet global usando recursos distribuidos. La potencia inform\u00e1tica de Googlebot se distribuye por medio de de un enorme sistema de centros de datos, por lo que puede crawlear cientos de webs simult\u00e1neamente.\n<\/p>\n<h2>\n<span class=\"mw-headline\" id=\"Informaci.C3.B3n_general\">Informaci\u00f3n general<\/span><br \/>\n<\/h2>\n<p>La tecnolog\u00eda de crawl de Google es simplemente un algoritmo que funciona de forma independiente. Se basa en el concepto de la WWW (world wide web). Internet puede ser concebido como una red muy grande de webs, incluyendo nodos, enlaces, hiperv\u00ednculos.\n<\/p>\n<p>Matem\u00e1ticamente, este concepto puede describirse como un gr\u00e1fico. Cada nodo es alcanzable por medio de de una direcci\u00f3n web, la URL. Los enlaces en una web conducen a otras subp\u00e1ginas u otros recursos con otra URL o direcci\u00f3n de dominio. Por ende, el crawler distingue entre enlaces HREF (las conexiones) y enlaces SRC (los recursos). La rapidez y eficacia con la que un crawler puede buscar en todo el gr\u00e1fico se describe en la teor\u00eda de gr\u00e1ficos.\n<\/p>\n<p>Google trabaja con distintos t\u00e9cnicas. Por un lado, Google usa el <b>multi-threading<\/b>, es decir, el procesamiento simult\u00e1neo de varios procesos de crawl. A parte de esto, Google trabaja con crawlers focalizados, que se enfocan en temas tem\u00e1ticamente restringidos, por ejemplo, la b\u00fasqueda en la web de ciertos tipos de enlaces, sitios web o contenido. Google tiene un bot para crawlear im\u00e1genes, uno para promoci\u00f3n comercial en buscadores y otro para dispositivos m\u00f3viles.\n<\/p>\n<h2>\n<span class=\"mw-headline\" id=\"Aplicaci.C3.B3n_pr.C3.A1ctica\">Aplicaci\u00f3n pr\u00e1ctica<\/span><br \/>\n<\/h2>\n<p>Los webmasters y operadores web disponen distintos opciones para proporcionar informaci\u00f3n sobre sus sitios al crawler, o inclusive para negarla. Cada crawler se etiqueta inicialmente con el t\u00e9rmino \u00abagente de usuario\u00bb. El nombre de Googlebot en los archivos de registro del servidor es \u00abGooglebot\u00bb con la direcci\u00f3n de host \u00abgooglebot.com\u00bb.<sup id=\"cite_ref-1\" class=\"reference\">[1]<\/sup><\/p>\n<p>Para el buscador Bing, es \u00abBingBot\u00bb y la direcci\u00f3n es \u00abbing.com\/bingbot.htm\u00bb. Los archivos de registro revelan qui\u00e9n env\u00eda las solicitudes al servidor. Los webmasters pueden negar el acceso a ciertos bots o concederles acceso. Esto se hace por medio de del archivo Robots.txt, utilizando el atributo Disallow: o con ciertas metaetiquetas de un documento HTML. Al a\u00f1adir una metaetiqueta en la p\u00e1gina web, el webmaster puede conceder al Googlebot un acceso limitado a la data de su sitio, seg\u00fan sea necesario. Esta metaetiqueta podr\u00eda verse as\u00ed:\n<\/p>\n<pre>&lt;meta name = \"Googlebot\" content = \"nofollow\" \/&gt; \n<\/pre>\n<p>Se puede definir la frecuencia con la que Googlebot debe crawlear una web. Esto se hace normalmente en la Consola de B\u00fasqueda de Google. Esto es sobre todo recomendable cuando el crawler reduce el rendimiento del servidor o si el portal web se actualiza muchas veces y, de este modo, debe crawlearse muchas veces. Hace falta conocer el n\u00famero de p\u00e1ginas de una web que van a ser crawleadas, puesto que es esencial saber el presupuesto del crawl.\n<\/p>\n<h2>\n<span class=\"mw-headline\" id=\"Relevancia_para_el_SEO\">Relevancia para el SEO<\/span><br \/>\n<\/h2>\n<p>Es sobre todo importante saber c\u00f3mo funciona Googlebot para la optimizaci\u00f3n de los motores de b\u00fasqueda de los sitios web, no s\u00f3lo en teor\u00eda, sino especialmente en <b>la pr\u00e1ctica<\/b>. Es recomendable proporcionar una nueva URL al crawler (seeding), es decir, proporcionar al bot una direcci\u00f3n como URL de inicio. Puesto que el bot encontrar\u00e1 contenido y enlaces adicionales en otros sitios web por medio de de enlaces, un link HREF sobre un recurso espec\u00edfico puede garantizar que el bot recibir\u00e1 una nueva URL.\n<\/p>\n<p>Tu b\u00e1sicamente env\u00edas un ping a la WWW. Tarde o temprano, Googlebot se encontrar\u00e1 con la direcci\u00f3n. Al mismo tiempo, se recomienda proporcionar sitemaps al bot. Esto le da informaci\u00f3n importante sobre la estructura de tu web y a la vez sabr\u00e1 qu\u00e9 URL debe seguir a continuaci\u00f3n. Esto es concretamente \u00fatil cuando se ha relanzado una web.\n<\/p>\n<p>Puesto que Googlebot puede leer distintos tipos de contenido, no s\u00f3lo texto o im\u00e1genes, deber\u00edas estar atento al desarrollo web. Google ha estado trabajando durante varios a\u00f1os en la lectura de contenido Flash, p\u00e1ginas web din\u00e1micas, JavaScript y c\u00f3digo Ajax y ya tiene un \u00e9xito parcial en estas \u00e1reas.<sup id=\"cite_ref-2\" class=\"reference\">[2]<\/sup>  Ciertos m\u00e9todos como GET o POST ya pueden ser identificados por Googlebot y partes del contenido Flash adem\u00e1s pueden ser le\u00eddos.<sup id=\"cite_ref-3\" class=\"reference\">[3]<\/sup><\/p>\n<h2>\n<\/h2>\n<h2>\n<span class=\"mw-headline\" id=\"Enlaces_Web\">Enlaces Web<\/span><br \/>\n<\/h2>\n<ul>\n<li> <a rel=\"nofollow noopener noreferrer\" target=\"_blank\" class=\"external text\" href=\"http:\/\/www.brighthub.com\/internet\/google\/articles\/41953.aspx\">Definici\u00f3n de Googlebot y m\u00e1s informaci\u00f3n<\/a>\n<\/li>\n<li> <a rel=\"nofollow noopener noreferrer\" target=\"_blank\" class=\"external text\" href=\"http:\/\/www.googleguide.com\/google_works.html\">C\u00f3mo funciona Google<\/a>\n<\/li>\n<\/ul>\n<p><!-- \nNewPP limit report\nCached time: 20200502155330\nCache expiry: 86400\nDynamic content: false\nCPU time usage: 0.008 seconds\nReal time usage: 0.010 seconds\nPreprocessor visited node count: 70\/1000000\nPreprocessor generated node count: 140\/1000000\nPost\u2010expand include size: 0\/2097152 bytes\nTemplate argument size: 0\/2097152 bytes\nHighest expansion depth: 2\/40\nExpensive parser function count: 0\/100\n--><!-- \nTransclusion expansion time report (%,ms,calls,template)\n100.00%    0.000      1 - -total\n--><!-- Saved in parser cache with key es_:stable-pcache:idhash:444-0!*!0!!es!*!* and timestamp 20200502155330 and revision id 2418\n -->\n<\/div>\n","protected":false},"excerpt":{"rendered":"<p>Googlebot is Google&#039;s crawler, which collects documents from the Internet and delivers them later for Google search. Collect documents through an automated procedure,\u2026<\/p>","protected":false},"author":1,"featured_media":0,"parent":0,"template":"","glossary-cat":[],"class_list":["post-69489","glossary","type-glossary","status-publish"],"yoast_head":"<!-- This site is optimized with the Yoast SEO Premium plugin v27.0 (Yoast SEO v28.2) - https:\/\/yoast.com\/product\/yoast-seo-premium-wordpress\/ -->\n<title>Googlebot - R Marketing Digital<\/title>\n<meta name=\"robots\" content=\"index, follow, max-snippet:-1, max-image-preview:large, max-video-preview:-1\" \/>\n<link rel=\"canonical\" href=\"https:\/\/rmarketingdigital.com\/en\/wiki\/googlebot\/\" \/>\n<meta property=\"og:locale\" content=\"en_US\" \/>\n<meta property=\"og:type\" content=\"article\" \/>\n<meta property=\"og:title\" content=\"Googlebot\" \/>\n<meta property=\"og:description\" content=\"Googlebot es el crawler de Google, que recopila documentos de Internet y los entrega m\u00e1s tarde para la b\u00fasqueda de Google. Recopila documentos por medio de de un procedimiento automatizado,...\" \/>\n<meta property=\"og:url\" content=\"https:\/\/rmarketingdigital.com\/en\/wiki\/googlebot\/\" \/>\n<meta property=\"og:site_name\" content=\"R Marketing Digital\" \/>\n<meta property=\"article:modified_time\" content=\"2024-10-28T21:51:17+00:00\" \/>\n<meta name=\"twitter:card\" content=\"summary_large_image\" \/>\n<script type=\"application\/ld+json\" class=\"yoast-schema-graph\">{\"@context\":\"https:\\\/\\\/schema.org\",\"@graph\":[{\"@type\":\"WebPage\",\"@id\":\"https:\\\/\\\/rmarketingdigital.com\\\/wiki\\\/googlebot\\\/\",\"url\":\"https:\\\/\\\/rmarketingdigital.com\\\/wiki\\\/googlebot\\\/\",\"name\":\"Googlebot - R Marketing Digital\",\"isPartOf\":{\"@id\":\"https:\\\/\\\/rmarketingdigital.com\\\/#website\"},\"datePublished\":\"2022-06-10T00:36:01+00:00\",\"dateModified\":\"2024-10-28T21:51:17+00:00\",\"inLanguage\":\"en-US\",\"potentialAction\":[{\"@type\":\"ReadAction\",\"target\":[\"https:\\\/\\\/rmarketingdigital.com\\\/wiki\\\/googlebot\\\/\"]}]},{\"@type\":\"WebSite\",\"@id\":\"https:\\\/\\\/rmarketingdigital.com\\\/#website\",\"url\":\"https:\\\/\\\/rmarketingdigital.com\\\/\",\"name\":\"R Marketing Digital\",\"description\":\"Agencia SEO | Publicidad redes sociales | Community Management\",\"potentialAction\":[{\"@type\":\"SearchAction\",\"target\":{\"@type\":\"EntryPoint\",\"urlTemplate\":\"https:\\\/\\\/rmarketingdigital.com\\\/?s={search_term_string}\"},\"query-input\":{\"@type\":\"PropertyValueSpecification\",\"valueRequired\":true,\"valueName\":\"search_term_string\"}}],\"inLanguage\":\"en-US\"}]}<\/script>\n<!-- \/ Yoast SEO Premium plugin. -->","yoast_head_json":{"title":"Googlebot - R Digital Marketing","robots":{"index":"index","follow":"follow","max-snippet":"max-snippet:-1","max-image-preview":"max-image-preview:large","max-video-preview":"max-video-preview:-1"},"canonical":"https:\/\/rmarketingdigital.com\/en\/wiki\/googlebot\/","og_locale":"en_US","og_type":"article","og_title":"Googlebot","og_description":"Googlebot es el crawler de Google, que recopila documentos de Internet y los entrega m\u00e1s tarde para la b\u00fasqueda de Google. Recopila documentos por medio de de un procedimiento automatizado,...","og_url":"https:\/\/rmarketingdigital.com\/en\/wiki\/googlebot\/","og_site_name":"R Marketing Digital","article_modified_time":"2024-10-28T21:51:17+00:00","twitter_card":"summary_large_image","schema":{"@context":"https:\/\/schema.org","@graph":[{"@type":"WebPage","@id":"https:\/\/rmarketingdigital.com\/wiki\/googlebot\/","url":"https:\/\/rmarketingdigital.com\/wiki\/googlebot\/","name":"Googlebot - R Digital Marketing","isPartOf":{"@id":"https:\/\/rmarketingdigital.com\/#website"},"datePublished":"2022-06-10T00:36:01+00:00","dateModified":"2024-10-28T21:51:17+00:00","inLanguage":"en-US","potentialAction":[{"@type":"ReadAction","target":["https:\/\/rmarketingdigital.com\/wiki\/googlebot\/"]}]},{"@type":"WebSite","@id":"https:\/\/rmarketingdigital.com\/#website","url":"https:\/\/rmarketingdigital.com\/","name":"R Digital Marketing","description":"SEO Agency | Advertising social networks | Community Management","potentialAction":[{"@type":"SearchAction","target":{"@type":"EntryPoint","urlTemplate":"https:\/\/rmarketingdigital.com\/?s={search_term_string}"},"query-input":{"@type":"PropertyValueSpecification","valueRequired":true,"valueName":"search_term_string"}}],"inLanguage":"en-US"}]}},"_links":{"self":[{"href":"https:\/\/rmarketingdigital.com\/en\/wp-json\/wp\/v2\/glossary\/69489","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/rmarketingdigital.com\/en\/wp-json\/wp\/v2\/glossary"}],"about":[{"href":"https:\/\/rmarketingdigital.com\/en\/wp-json\/wp\/v2\/types\/glossary"}],"author":[{"embeddable":true,"href":"https:\/\/rmarketingdigital.com\/en\/wp-json\/wp\/v2\/users\/1"}],"version-history":[{"count":0,"href":"https:\/\/rmarketingdigital.com\/en\/wp-json\/wp\/v2\/glossary\/69489\/revisions"}],"wp:attachment":[{"href":"https:\/\/rmarketingdigital.com\/en\/wp-json\/wp\/v2\/media?parent=69489"}],"wp:term":[{"taxonomy":"glossary-cat","embeddable":true,"href":"https:\/\/rmarketingdigital.com\/en\/wp-json\/wp\/v2\/glossary-cat?post=69489"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}