El término contenidoEl contenido puede ser muy difícil de definir con precisión. Es una definición que se refiere a las declaraciones contenidas en un documento o publicación de cualquier tipo y puede incluir las tecnologías de la información y la comunicación. Esto cubre todos los tipos de medios como imágenes y texto. A parte de esto, en el campo de la optimización de motores de búsqueda, los términos duplicar contenido, contenido único, más duplicado, o duplicate content proviene de SEO ¿Qué es SEO o search engine optimization? Conjunto de prácticas destinadas a mejorar el posicionamiento de una web en el ranking de resultados de los motores de búsqueda. Al contrario que la estrategia SEM, que contempla la inclusión de enlaces contratados para obtener este objetivo, el procedimiento SEO se ocupa exclusivamente de los resultados naturales (no pagados) localizados por el algoritmo propio de cada buscador. Para esto contempla ajustar más. El contenido duplicado se crea cuando se puede ingresar al mismo contenido con distintos URLEl URL (Localizador Uniforme de Recursos), es una dirección definida que apunta a la posición de un archivo en un servidor y lo recupera. Las URL se introducen en un navegador web para ingresar a documentos en la web o se incrustan como hipervínculos dentro de un documento. Se puede usar un Permalink para que una URL esté disponible de forma permanente. Componentes de una URL • prefijo de protocolo más y se indexa con distintos URL. La indexaciónGeneralmente, la indexación' se refiere a un método de adquisición de información (desarrollo de información), a través el cual los documentos se recopilan y clasifican en función de palabras clave. Después, se forma un índice que es semejante a una biblioteca. Los documentos indexados, en su mayoría contenido de texto, se preparan para una búsqueda de un documento específico o palabra clave y se les proporcionan descriptores. Si quieres una más de sitios web con contenido duplicado puede tener un efecto negativo en el Ranking en los SERPsLa expresión SERPs proviene de las siglas de los términos en inglés Search Engine Result Pages es decir, páginas de resultados de los motores de búsqueda. En las SERPs es donde se encuentran los resultados de búsqueda de los motores de búsqueda y se organizan de mayor a menor relevancia. El posicionamiento lo determinan los motores de búsqueda de acuerdo al análisis de muchos factores y criterios de relevancia y más.
Tipos de contenido duplicado
El contenido duplicado puede surgir si:
- El contenido es sindicado, vendido o copiado ilegalmente, entonces distintos sitios web usan el mismo contenido. Para este caso, el contenido duplicado puede perjudicar al creador.
- El contenido de un portal web se muestra accidentalmente en distintos dominios o subdominios (por ejemplo, sin «www»).
- El contenido se usa dos veces en distintos categorías. Esto puede ocurrir si el contenido de una URL se publica en un área de noticias.
- El sistema de administración de contenidos no puede asignar URLs únicas al contenido.
- Distintos filtrosConcepto de Filtros¿Qué son los Filtros?Los Filtros son unos mecanismos que, sea en el campo de la informática o en el de las páginas web, se usan para establecer qué tipo de contenidos se deben visualizar o mostrar por pantalla, o cuáles no deben aparecer. Es algo que se emplea en numerosos lugares con fines muy distintos, pero que siempre tiene como objetivo perfilar la búsqueda para acertar mejor con más de atributos en las tiendas online ofrecen las mismas listas de productos.
El contenido casi duplicado es un contenido muy semejante que además podría dar lugar a problemas. Los bloques de texto que se copian muchas veces (como teasers o textos recurrentes en cada página) pueden ser representados como contenido duplicado por los motores de búsquedaConcepto de Motores de Búsqueda¿Qué son los Motores de Búsqueda?Los Motores de búsqueda, o Search Engines, son lo que se conoce comúnmente como buscadores. Todos aquellos sistemas informáticos que trabajan buscando todos los archivos almacenados en internet por medio de de arañas o crawlers para elaborar páginas de resultados que sirvan para que los usuarios accedan a webs tras realizar una búsqueda. Son los responsables de que, al buscar cualquier más.
Antecedentes
Google] ha hecho varios ajustes a sus algoritmos para asegurar que el motor de búsquedaUn motor de búsqueda es un programa de PC utilizado para buscar datos. Los resultados de la búsqueda se muestran como enlaces en las páginas de resultados de los motores de búsqueda (SERPs), que se pueden usar para conseguir la información deseada. Con la finalidad de establecer la relevancia de una consulta para los datos existentes en el índice, los motores de búsqueda de hoy, trabajan con algoritmos sofisticados. Cómo más pueda filtrar el contenido duplicado muy bien. Tanto el Brandy Update de 2004 como el Bourbon Update de 2005 mejoraron la capacidad de Google para detectar contenido duplicado.
Consecuencias del contenido duplicado
El contenido duplicado presenta un obstáculo a los motores de búsqueda. Disponen que elegir cuál de las páginas duplicadas es la más relevante para una consulta de búsqueda. Google subraya que «la duplicación de contenido en un portal web[…] no es una razón para tomar medidas contra este portal web». A pesar de todo, el proveedor del motor de búsqueda se reserva el derecho de imponer sanciones por intenciones manipuladoras: «En los raros casos en que tengamos que asumir que el contenido duplicado se muestra con la intención de manipular el posicionamientp o engañar a nuestros usuarios, hacemos las correcciones apropiadas al índice y ranking de los sitios web en cuestión». Los webmasters no deben dejar que Google decida si el contenido duplicado es involuntario o se ha creado deliberadamente; básicamente deben evitar el contenido duplicado.
Causas técnicas del contenido duplicado
El contenido duplicado puede tener distintos causas, que frecuentemente se basan en la configuración incorrecta de los servidores.
Duplicación de contenido debido a una mala configuración del servidorLos servidores son ordenadores centrales y potentes dentro del campo de la tecnología de la información que procesan y proporcionan software y archivos en una red. Desde el punto de vista de un cliente, varios ordenadores en una red pueden ponerse en contacto con el servidor central para conseguir la información solicitada. En la arquitectura cliente-servidor, el servidor puede ser un software que proporciona un servicio y se ejecuta en más
Los argumentos para evitar la duplicación de contenido dentro del propio portal web se encuentran en la configuración del servidor. Los siguientes problemas pueden ser resueltos fácilmente:
Contenido duplicado debido a un subdominioConcepto de Subdominio¿Qué es un Subdominio?Un Subdominio es una extensión que se añade al nombre de un dominio para organizar las distintos secciones que pueda tener su web, aún cuando funcionando de forma totalmente independiente a esta. Por lo general, generalmente son palabras que lo preceden y que se separan de él utilizando un punto para remarcar tanto su independencia como la idea de que son algo desligado del contenido más Catch-All / Wildcards
Uno de los errores más básicos de SEO de una página surge cuando un dominioUn dominio es una sección de Internet con direcciones que comparten un sufijo común o están bajo el control de una organización o individuo en particular. Está organizado jerárquicamente. Tanto los objetos físicos como los virtuales pueden ser direccionados con el nombre de dominio. Estos objetos pueden ser webs, ordenadores en red o servicios, como impresoras, faxes o servidores de correo. Cada objeto está referenciado por una dirección IP única, más responde simultáneamente a todos los subdominios. Esto se puede probar fácilmente básicamente visitando
«h
"http://www.DOMINIO.com” seguido de “http://dominio.com” (i.e, sin “www”)
Si se muestra el mismo contenido en ambos casos (y la barra de direcciones sigue mostrando el dominio ingresado), se debe actuar rápidamente. En el peor de los casos, el servidor responde a todos los subdominios, incluyendo un subdominio como
“http://potatoe.DOMINIO.com”
Estas otras páginas con el mismo contenido se denominan dobles. Para facilitar que los motores de búsqueda decidan qué URL es relevante, se debe configurar el servidor correctamente. Esto se puede hacer, por ejemplo, utilizando el módulo mod-rewrite para el servidor Apache Concepto de Apache ¿Qué es y qué hace Apache? Apache es un software especializado en ofrecer servicios de servidor web. Es versátil, ligero y muy útil, al mismo tiempo de ser absolutamente sin costes y de código abierto. Su popularidad es tal que, hoy en día, cerca del 50% de las páginas web de todas partes se ejecutan en un servidor de este tipo. Aún cuando se le conoce más comúnmente usado. Con un archivo.htaccess en el directorio raízUn directorio raíz (en inglés root directory), es el directorio del nivel más alto de una jerarquía. Además se conoce como documento raíz. Desde esta raíz todos los demás directorios se ramifican. En el caso de las webs, los archivos más necesarios, como las páginas HTML, se encuentran en el directorio raíz del servidor desde el que se solicitará su visualización mediante del navegador. Los directorios raíz además se usan más del portal web, se puede enseñar el siguiente código al servidor mediante de una redirección 301Concepto de Redirección 301¿Qué es una Redirección 301?La redirección 301 es un recurso muy empleado dentro del ámbito web, único lugar en el que existe, para mover páginas y redireccionar tráfico. Es una forma de indicar a los robots de los buscadores como Google que, en vez de dirigirse a una página, han de dirigirse a otra de forma permanente. Así, al mismo tiempo, se le da más fuerza de más para asegurarse de que el portal web sólo responde al dominio correcto – y redirige automáticamente los subdominios habituales al dominio correcto:
RewriteEngine On
# ! Please remember to replace “DOMAIN2 with the respective domain of your project !
RewriteCond %{HTTP_HOST} !^www.DOMAIN.com$ [NC]
RewriteRule (.*) http://www.DOMAIN.com/$1 [R=301,L]
Como consideración preliminar, uno debería primero elegir cuál debería ser el dominio principal – es decir, con o sin «www»? En el caso de los sitios web internacionales, la identificación del país además debe considerarse un subdominio.
http://en.DOMAIN.com/
Duplicar el contenido debido a la falta de barrasLas trailing slashes son las barras que aparecen al final de una URL ( "https://es.ryte.com/" ) y representan un directorio. Si la URL no finaliza con una barra representa un archivo. No obstante, esto son solo guías, no un requerimiento. No obstante, usar una barra como representación de un directorio ha sido aceptado como estándar con el tiempo. Uso de las barras "https://es.ryte.com/" y SEO A pesar de que dichas más
Otra forma generalizada de contenido duplicado surge del uso de barras oblicuas. Estas son URLs que no contienen nombres de archivos sino que apuntan a directorios. Por ejemplo:
http://www.DOMAIN.com/register_a/register_b/
Esto (normalmente) abre el archivo de índice de la subcarpeta «register_b». Dependiendo de la configuración, la próxima URL además responde de manera semejante:
http://www.DOMAIN.com/register_a/register_b
En el ejemplo anterior, falta la última barra. El servidor primero intenta hallar el archivo «register_b», que no existe, pero posteriormente se da cuenta de que existe tal carpeta. Ya que el servidor no desea devolver un mensaje de error innecesario («archivo no existe»), se muestra el archivo índice de esta carpeta. En principio, esto es algo bueno pero desafortunadamente resulta en contenido duplicado (tan pronto como un link apunta a una URL «falsa»). Este problema se puede tratar de distintos maneras:
- 301 Redirigir mediante de .htaccess.
- Etiqueta canónica que apunta a la URL correcta.
- Bloqueo por medio de robots.txtEl archivo robots.txt es un documento que establece qué partes de un dominio pueden ser analizadas por los rastreadores de los motores de búsqueda y proporciona un link al XML-sitemap. Estructura El llamado “Robots Exclusion Standard Protocol“, Protocolo Estándar de Exclusiones Robots, se publicó por primera vez en 1994. Este protocolo define que los rastreadores de los motores de búsqueda deben buscar y leer el archivo llamado “robots.txt“ antes de más.
- Corrección de todos los enlaces mal escritos (difícil para los enlaces entrantes).
La mejor manera de hacerlo es utilizando un redireccionamiento 301 vía .htaccess así como rectificando enlaces defectuosos. Esto ahorra a Google los problemas innecesarios de crawl que, a su vez, pueden ser de beneficio para el portal web en un punto distinto.
Tratamiento de contenidos duplicados
Las tareas de optimización de una página no sólo consisten en evitar la duplicación de contenidos, sino además en identificarlos y actuar de forma adecuada. El llamado Duplicate Content CheckerEl Duplicate Content Checker, o revisor de contenido duplicado, se utiliza para hallar contenido duplicado en Internet. Sobre la base de los resultados de los análisis, los webmasters y SEOs pueden dirigir de forma directa el contenido duplicado usando etiquetas canónicas u otras medidas, puesto que el contenido duplicado impide una buena clasificación de un portal web. Desde un punto de vista legal, un corrector de contenido duplicado puede ayudar más puede ayudar aquí. Enumera las URLs que muestran contenido semejante. Es concretamente importante que los webmasters y SEOs actúen apropiadamente en el caso de contenido duplicado. Ya que la indexación siempre es más rápida en los robots de los motores de búsqueda, el contenido semejante además llega más rápido a la Web. Esto da como resultado el riesgo de una mala clasificación o inclusive una exclusión acelerada del índice.
Unicidad del texto
Los contenidos duplicados frecuentemente impactan a las tiendas online que se hacen cargo de los textos de los productos 1:1 de los fabricantes y además los usan para los portales de comparación de precios. Matt CuttsMatthew Cutts ha estado trabajando como desarrollador de software en el buscador de Google desde enero de 2000 y es responsable tanto de mejorar la calidad de las búsquedas como del equipo de webspam. Durante muchos años, Matt Cutts ha proporcionado información pública para la optimización de motores de búsqueda de sitios web. Con miles de videos en su canal de YouTube y constantes contribuciones en foros de webmasters como más ya ha expresado su opinión sobre este tema. [1] De esta manera, debes crear textos distintos para tu propia página de inicio y comparaciones de precios o portales de compras externos. Aún cuando pueda parecer una tarea problemática, los textos individualizados para distintos páginas valen la pena – en primer lugar, tu propia web y tu marca se verán fortalecidos, y en segundo lugar, las comparaciones de precios recibirán textos individualizados y de este modo más interesantes tanto para Google como para el usuario.
Con la finalidad de evitar la duplicación de contenido onlineConcepto de Contenido Online¿Qué es el Contenido Online?El Contenido online es todo aquel contenido que se construye con la finalidad de ser compartido mediante del sector digital, o más bien, de internet. Es decir, es un campo que engloba textos, imágenes estáticas o dinámicas, vídeos o inclusive formatos sonoros que se comparten en la red como parte de una propuesta de marketing o con cualquier otra finalidad.Hemos mencionado al marketing, más en el propio sitio, los webmasters deben revisar su contenido cuidadosamente y potencialmente considerar si algunas categorías pueden ser fusionadas. En algunos casos, además puede ser útil marcar las páginas de filtro con la etiqueta «noindexEl comando “noindex” se sitúa en las metaetiquetas para informar a los rastreadores de los motores de búsqueda que la página visitada no debe ser indexada. Los webmasters disponen con esta función la oportunidad de manipular el procedimiento de indexación de sus páginas. Implementación La metaetiqueta “noindex” se incorpora en el código fuente de un portal web al final del <head> y en la zona de los Metadatos. Aparece del más, follow», por ejemplo. Los motores de búsqueda no indexan estas páginas, sino que siguen los enlaces que aparecen en ellas.
Para crear contenido únicoEl Contenido Único o unique content se establece como contenido editorial online, que no existe en ningún otro portal web. La unicidad del texto es un factor de posicionamiento importante para los motores de búsqueda y se trata como un Punto Único de Venta (USP) de una web. Creación El contenido único puede ser creado por cualquiera que maneje el contenido editorial de una web. Se debe observar una buena más, se dispone de herramientas que disponen en cuenta la fórmula TF*IDFCon la fórmula TF*IDF puedes repasar la importancia que disponen ciertas palabras de un texto o de un portal web en comparación con todos los documentos disponibles. Esta fórmula se utiliza no solo para el cálculo de la densidad de las palabras clave sino además, para la Optimización OnPage: incrementar la relevancia de un portal web en los motores de búsqueda. TF Las siglas TF provienen de la expresión en más.
Contenido THEFT
En caso de que se produzca una duplicación de contenido externa como resultado de un «robo de contenido», deberás ponerte inmediatamente en contacto con el webmasterEl término webmaster fue utilizado por primera vez por Tim Berners-Lee, el inventor de la World Wide Web, en su documento "Style Guide for Online Hypertext". La palabra se compone de las palabras inglesas "web", forma corta de World Wide Web y "master". En los primeros días de la WWW, a principios de la década de 1990, el término se usaba principalmente como un nombre profesional para las personas que disponen más respectivo y solicitarle que incluya la fuente original del texto o que elimine el texto. En la mayoría de los casos, una simple petición es suficiente. Además puede emitirse una advertencia en casos extremos. Al mismo tiempo, los webmasters disponen la oportunidad de denunciar a Google las páginas que violan los derechos de autor al copiar contenido. Este formulario se puede enviar desde la Consola de Búsqueda de GoogleEn este momento, la búsqueda en Google o Google Search es un medio de búsqueda de contenido en la web a nivel mundial. Desde que fue creado en 1997, la búsqueda en Google se ha convertido en un punto central para muchas actividades web. La búsqueda web es sólo un componente de la cartera general de Google Inc. A pesar de todo, es la plataforma principal para entregar anuncios de más.
RedirecciónUn redirect (abreviatura de redirección) es un reenvío automático del lado del servidor o del cliente de una URL a otra. Las redirecciones se usan para múltiples fines, como la reubicación de un portal web en un nuevo dominio o el mantenimiento de un servidor. Con un 301-redirect, el contenido duplicado puede, por ejemplo, ser evitado. Antecedentes Una redirección suele ser siempre automática y apenas percibida por el usuario. Sobre más 301
Si surge contenido duplicado externo debido a que un webmaster está operando dos sitios web con el mismo contenido en dos o más dominios, un Redireccionamiento 301 es frecuentemente suficiente para prevenir el contenido duplicado.
Otra alternativa es dar a conocer a Google la versión preferida de un portal web mediante de la Consola de Búsqueda de Google, por ejemplo.
Etiqueta canónica, etiqueta noindex y robots.txt
Hay varias alternativas cuando consiste en contenido interno duplicado en el propio portal web. La etiqueta canónica es una herramienta importante en esta circunstancia. Esto hace referencia a la subpágina duplicada a la página original, y el duplicado está exento de la indexación. Si necesitas estar completamente seguro de que una subpágina con contenido duplicado no está indexada, puedes marcarla usando una etiqueta noindex. Para excluir adicionalmente el contenido duplicado del crawl, las respectivas subpáginas además se pueden guardar en el archivo robots.txt.
Etiquetas hreflangHreflang es un atributo que informa a Google y a otros motores de búsqueda sobre las distintos versiones lingüísticas de una página web. El contenido de la web se entregará para que coincida con la región de destino del usuario. La correcta implementación del atributo hreflang puede ser, de esta manera, beneficiosa para la usabilidad e indirectamente beneficiosa para el SEO. Contexto Con la creciente internacionalización de los sitios web, Google introdujo más en páginas traducidas
Ahora Google puede identificar bien las páginas traducidas y asignar el contenido a una página original. Con la finalidad de evitar la duplicación de contenido mediante de traducciones o idiomas idénticos para distintos mercados de destino, la etiqueta se puede usar para indicar la región y el idioma de las URL individuales. De este modo, Google reconoce que hay traducciones de una página y que la URL dispone de una cierta orientación.
Un ejemplo: una tienda online alemana además ofrece sus productos en la parte de habla alemana de Suiza y en Austria. Para este caso, el idioma de destino es el alemán. A pesar de todo, la tienda usa el país respectivo que termina en y para los países de destino. Para evitar la duplicación de contenido, se colocará en la cabecera de la versión alemana para referirse a una variante para Suiza.
Rel=alternativo con subdominios móviles=
La optimización smartphone además puede producir contenido duplicado. Esto es fundamentalmente cierto si el portal web smartphone tiene su propio subdominio. El contenido duplicado puede ser evitado utilizando la etiqueta rel=alternativa. La etiqueta se refiere desde la versión de escritorio a la versión smartphone. Los motores de búsqueda reconocerán entonces que el dominio es el mismo y evitarán la doble indexación.
Prevención
Para evitar la duplicación de contenido interno, es aconsejable planificar la jerarquía de páginas de forma adecuada. Esto permite detectar de antemano posibles fuentes de contenido duplicado. Al crear productos en tiendas en línea, además se deben hacer preparativos para la fácil implementación de etiquetas canónicas. Lo siguiente es válido para el nivel de texto: Cuanto más individualizado es el texto, mejor es para Google y el usuario, y más fácil es evitar el contenido duplicado.
Verificador de contenido duplicado
Para el primer análisis está habilitada el llamado Duplicate Content Checker, como por ejemplo desde copyscape o Ryte. Estas herramientas identifican inicialmente contenidos similares o inclusive idénticos en la web. Las tiendas online, en particular, que transmiten los datos de sus productos mediante de archivos CSV a portales de comparación de precios o plataformas de venta como AmazonConcepto de Amazon¿Qué es Amazon?Amazon es la tienda online más importante de todas partes (haz un clic aquí para ver la web de Amazon). Se trata del icono más representativo del e-commerce y de una de las webs más frecuentadas por los usuarios de medio planeta. Cuenta con un catálogo repleto de productos de todos los tipos y sectores y con precios y condiciones que suelen atraer las miradas de más, suelen verse afectadas por estos problemas. Matt Cutts ya ha expresado su opinión sobre este tema. [2]
Enlaces Web
- Google Support: contenido duplicado
- Video de Matt Cutts: Si cito otra fuente, ¿me penalizarán por contenido duplicado?





