Cómo funcionan los buscadores por dentro

Por Santos Jaimes · ·

Escribes tres palabras, presionas Enter, y en medio segundo aparecen diez resultados de entre miles de millones de páginas. Suena a magia. No lo es: son tres procesos separados trabajando desde hace semanas, mucho antes de que a ti se te ocurriera buscar nada.

La anatomía de un buscador

Un motor de búsqueda tiene cuatro piezas, y solo una la ves tú:

  • La interfaz de consulta: la cajita de texto. Es literalmente la única parte del buscador que ve el usuario. Todo lo demás pasa detrás del telón.
  • Los rastreadores (crawlers, spiders, robots): los programas que recorren la web recolectando información de cada URL.
  • Las bases de datos: almacenes gigantescos donde se guardan múltiples datos sobre cada URL de la web.
  • El algoritmo de búsqueda: el engranaje que hace que todo funcione. Toma un problema (tu consulta), evalúa un montón de respuestas posibles y devuelve una solución ordenada.

Y el flujo que conecta todo eso son tres etapas: rastrear → indexar → rankear. Vamos una por una, porque entenderlas separadas es lo que después te salva cuando algo no aparece en Google.

Etapa 1: el rastreo (crawling)

El rastreo es el proceso automatizado y sistemático de recuperar documentos web, iniciado por una araña (spider). Es el paso previo a la indexación y no tiene absolutamente ninguna influencia en cómo se posicionan las páginas. Solo recolecta.

El robot de Google se llama Googlebot. El de Bing es MSNBot. Yahoo! tuvo el suyo, llamado Slurp. Todos se comportan de forma parecida: entran a una página, leen el HTML, extraen los enlaces que encuentran y se van a visitarlos. Y así, indefinidamente.

Un detalle simpático para quien administra servidores: Googlebot soporta compresión del servidor web, lo cual permite transferencias de archivos más rápidas y conviene tenerla activada siempre que se pueda.

Por qué el robot podría no llegar a tu página

Aquí viene la parte que sorprende: la web es demasiado grande para que ningún buscador la recorra entera. Google tiene que priorizar la eficiencia de su rastreador limitando cuánto contenido rastrea y con qué frecuencia. No hay ninguna garantía de que llegue a todo tu sitio, especialmente si es grande.

Las razones típicas por las que una URL tuya se queda sin rastrear:

  • El rastreador nunca encuentra un enlace hacia esa URL y tampoco aparece en tu sitemap XML. (A veces sí enlazas la página, pero solo mediante JavaScript que no se renderiza hasta que el usuario hace clic en algo.)
  • El rastreador conoce la URL, pero está muy abajo en tu jerarquía — tendría que pasar por varias páginas para llegar — y decide que no vale la pena.
  • Ya la rastreó en el pasado y, por lo que interpretó del contenido, decidió que no hace falta volver.
  • Tu sitio tiene un presupuesto de rastreo limitado y no alcanza. Esto pasa, por ejemplo, si el servidor daba problemas ese día o si hay muchas URLs con exactamente el mismo contenido.

Ese último punto es importante y poco intuitivo: el contenido duplicado no solo confunde, además gasta rastreo que podría haberse usado en páginas que sí te importan.

También existe lo que se llama una trampa para buscadores (search engine trap): situaciones en las que la araña simplemente no puede ver la totalidad de tu sitio. Menús que dependen de JavaScript, contenido tras un formulario, enlaces que no son enlaces de verdad.

Más sobre estructura del sitio y jerarquía aquí

Qué tipos de archivo puede leer

Al principio los buscadores solo manejaban HTML. Eso quedó atrás hace mucho. Googlebot indexa, entre otros: PDF, PostScript, feeds RSS y ATOM, KML y KMZ de Google Earth, hojas de Lotus 1-2-3, Lotus WordPro, MacWrite, Excel, PowerPoint, Word, Microsoft Works, Write, Open Document Format, RTF, Shockwave Flash y archivos de texto plano.

Los archivos JSP, ASP y PHP se indexan igual que cualquier documento HTML, porque lo que llega al robot es la salida ya procesada. Y con los documentos que no son HTML, el proceso normalmente consiste en extraer todo el texto antes de indexar.

👈 Traducción práctica: sí, Google puede leer tu menú en PDF. Pero lo va a convertir en texto plano sin estructura, sin encabezados y sin enlaces internos. Publica el menú en HTML.

Etapa 2: la indexación

La indexación es el proceso algorítmico de analizar y almacenar en un índice la información rastreada. Cada índice se crea con un conjunto de reglas, factores de ranking y pesos que después gobiernan la posición de una página para una palabra clave concreta.

La definición formal, la de manual, es que la indexación de buscadores recolecta, analiza sintácticamente y almacena datos para facilitar una recuperación de información rápida y precisa. El diseño de un índice mezcla lingüística, psicología cognitiva, matemáticas, informática y física. No es poca cosa.

Cuando se dice que un sitio "está indexado", significa que el buscador:

  1. Conectó con él por algún medio (un enlace desde una página que ya estaba en el índice, o un sitemap enviado por el panel del buscador).
  2. Lo rastreó con un script que descubre todos los enlaces para encontrar contenido nuevo.
  3. Lo renderizó completo, para poder ver todo el contenido de la página.
  4. Hizo análisis semántico del contenido para entender de qué tema trata.
  5. Creó metadatos descriptivos para poder asociarlo con las palabras e intenciones de quien busca.
  6. Lo guardó en una base de datos para recuperarlo más tarde ante una consulta relacionada.

Hoy, cuando hablamos del "índice de búsqueda", en realidad hablamos de un índice de índices, que contiene metadatos de muchos más tipos de activos que páginas HTML: imágenes, vídeos, documentos PDF y otros formatos.

⚠️ La regla que hay que tatuarse: que un documento sea rastreado no garantiza en absoluto que sea indexado. Son dos cosas distintas, en ese orden, y una no implica la otra.

Otro dato que la gente suele ignorar: la indexación no es un proceso completamente automatizado. Los sitios que se considera que practican técnicas de spam suelen ser eliminados y baneados manualmente. Y en el otro extremo, ciertos sitios pueden recibir un empujón de ranking basado en su propiedad o en su marca.

La fórmula exacta de indexación es, y va a seguir siendo, un secreto. Google publica guías y tutoriales sobre cómo optimizar, pero nunca va a compartir su tecnología de indexación, porque es el cimiento de su negocio.

Etapa 3: el ranking

Aquí es donde por fin entra tu consulta. El buscador revisa su índice y aplica un algoritmo: básicamente una ecuación matemática que pesa varios criterios sobre cada página y genera un resultado ordenado.

En conferencias del sector, representantes de Google han dicho que su algoritmo analiza más de 200 variables para determinar la posición de una página ante una consulta dada. ¿Cuáles son exactamente? No lo dicen. Ni ellos ni los demás buscadores. Y eso es precisamente lo que hace del SEO un desafío: se pueden hacer suposiciones educadas, pero suposiciones al fin.

Los algoritmos se basan en un sistema de pesos positivos y negativos diseñados por los ingenieros del buscador. Sumas puntos por unas cosas, los pierdes por otras.

Y cambian. Constantemente. Algunas modificaciones han sido tan profundas que sitios enteros desaparecieron de los resultados literalmente de un día para otro. La fuerza que empuja esos cambios es casi siempre la misma pareja:

  • Mejorar la calidad de los resultados
  • Penalizar las actividades de spam más características

Uno de los algoritmos de Google, el más famoso, es PageRank: un algoritmo de análisis de enlaces que asigna un peso numérico a cada elemento de un conjunto de documentos hiperenlazados, con el propósito de medir su importancia relativa dentro del conjunto.

Más sobre PageRank aquí · Más sobre relevancia aquí · Más sobre autoridad aquí

Dos buscadores, dos respuestas

Cada buscador usa algoritmos distintos. Por eso los resultados de uno son diferentes a los de otro aunque escribas exactamente las mismas palabras. Y por eso, además, los buscadores no son perfectos: a veces salen enlaces de spam completamente irrelevantes y hay que hacer algo de "masaje de keywords" para llegar a lo que uno buscaba.

Cómo ver tu página como la ve el robot

Este es el truco más útil de toda la sección. Si le quitas a una página todo el HTML, el JavaScript y el CSS, te queda el texto pelado. Eso es aproximadamente lo que un buscador procesa antes de indexar.

Formas de hacerlo:

  • Un navegador de texto, que navega solo por los enlaces textuales como en los primeros años de la web.
  • Desactivar JavaScript en el navegador y recargar. Lo que queda es más o menos lo que Google tiene garantizado ver.
  • Un script propio: los libros clásicos de SEO traen ejemplos en PHP de un "visor de araña" que recibe una URL y devuelve la vista despojada. Es un ejercicio de tarde y se aprende muchísimo.

Este ejercicio es especialmente revelador en sitios con muchos gráficos y archivos multimedia. Más de una vez descubres que la mitad de tu contenido, para el robot, no existe.

Dónde se rompe la cadena (la tabla de diagnóstico)

Cuando una página no aparece en Google, el 90% del trabajo es averiguar en cuál de las tres etapas se cortó la cadena. Esta tabla te ahorra horas:

SíntomaEtapa que fallóPor dónde empezar
Google no conoce la URL Rastreo ¿Hay enlaces internos hacia ella? ¿Está en el sitemap? ¿La bloquea robots.txt?
La conoce pero no la indexa Indexación ¿Tiene noindex? ¿Es contenido duplicado? ¿Aporta algo o es una página vacía?
Está indexada pero no rankea Ranking Relevancia y autoridad: ¿responde a la consulta? ¿alguien la enlaza?
Aparece pero sin descripción Rastreo bloqueado La URL está en robots.txt: Google la conoce por enlaces externos pero no pudo leerla
Tienes muchas más páginas indexadas de las que publicaste Indexación Casi siempre son parámetros de URL innecesarios generando duplicados
Tienes muchas menos de las que publicaste Rastreo o autoridad Problemas de acceso del rastreador, o muy pocos enlaces entrantes

Esos dos últimos casos vienen directo de la práctica de auditoría: un número de páginas indexadas anormalmente alto suele significar contenido duplicado por parámetros de URL, y uno anormalmente bajo suele deberse a problemas de rastreo o a tan pocos enlaces entrantes que los buscadores concluyen que las páginas no valen la pena.

Más sobre contenido que compite consigo mismo aquí

El caso de Little Italy Kitchen

Pongámoslo en concreto. Little Italy Kitchen, restaurante italiano en el barrio LoDo de Denver, tiene 25 páginas y una queja: "no salgo en Google". Aplicando las tres etapas:

  1. Rastreo. El menú está en un PDF enlazado desde un botón hecho con JavaScript. El robot nunca encontró el enlace, así que el menú entero — la página más importante del sitio — es invisible. Arreglo: menú en HTML, enlazado con un <a href> normal.
  2. Indexación. Cada plato tiene su propia página, pero todas repiten la misma descripción genérica cambiando solo el nombre. Google las considera duplicadas y se queda con una. Arreglo: descripciones reales, o menos páginas con más sustancia.
  3. Ranking. La página de inicio sí está indexada, pero en la posición 40 para "restaurante italiano Denver". Ni la relevancia (el <title> dice "Inicio") ni la autoridad (cero enlaces locales) le dan para más. Arreglo: los dos pilares, en ese orden.
📚 ¿Quieres el recorrido completo, con todos los temas en orden? Todo sobre SEO en una página.

Bibliografía

  1. SEOWarrior.txtSEO Warrior (John I. Jerkovic). Capítulo 2, "Search Engine Primer", pp. 28–33: comportamiento de Googlebot, MSNBot y Slurp; soporte de compresión del servidor; trampas para buscadores; tabla 2-1 con los tipos de archivo que indexa Googlebot; el visor de araña en PHP; la interfaz de consulta y comparación de SERPs; definición de indexación; eliminación manual de sitios spam; algoritmos como sistema de pesos positivos y negativos; definición de PageRank. Capítulo 9, "Robots Exclusion Protocol", p. 171: distinción formal entre crawling e indexing y la advertencia de que lo primero no garantiza lo segundo.
  2. theartofseo.txtThe Art of SEO (Enge, Spencer, Stricchiola). Capítulo 3, sección "Crawling", p. 73: la web es demasiado vasta para rastrearla entera, y las cuatro razones por las que un rastreador puede no llegar a una URL. Sección "The Index", pp. 74–75: el índice como "índice de índices" y los seis pasos que implica decir que un sitio está indexado.
  3. seoallinone.txtSEO All-in-One For Dummies. Libro 1, Capítulo 1, pp. 21–22: el spidering como primer paso, los distintos nombres del mismo programa, por qué los cambios en tu web tardan de un día a varias semanas en verse reflejados, qué implica indexar, y la cifra de más de 200 variables declarada por representantes de Google.
  4. seobible.txtSearch Engine Optimization Bible. Capítulo 1, pp. 7–8: la interfaz de consulta como única parte visible del buscador, la equivalencia entre crawlers, spiders y robots, el papel de las bases de datos y la definición de algoritmo de búsqueda como procedimiento de resolución de problemas.
  5. Search-Engine-Optimization-SEO-Secrets.txtSEO Secrets (Danny Dover), p. 242: diagnóstico de los datos de inclusión en buscadores; qué significa un número de páginas indexadas anormalmente alto (duplicados por parámetros de URL) o anormalmente bajo (problemas de rastreo o pocos enlaces entrantes).

Agregar comentario

* Información requerida
1000
Arrastrar y soltar imágenes (max 3)
Enter the word hand backwards.
Imagen captcha

Comentarios

Sin comentarios aún. ¡Sé el primero!