ZentimesESEN

Glosario

Los términos, con sus fuentes

Dieciséis términos que te vas a encontrar en este campo. Cada definición se sostiene sola, para que se pueda citar sin las de al lado. Cada término que nombra algo real enlaza a esa cosa.

Cada enlace externo de aquí se abrió y se comprobó, uno a uno, antes de publicarlo. Dos términos no tienen entidad externa propia y lo dicen, en vez de apuntar a algo parecido.

GEO (Generative Engine Optimization)

La práctica de preparar un sitio para que los motores de respuesta generativa puedan extraerlo, atribuirlo y citarlo. Trabaja sobre las propiedades mecánicas que un motor lee —estructura, entidades, acceso de rastreadores, renderizado—, no sobre la decisión del motor de citar.

Sin entidad externa todavíaSeis experimentos reproducibles →

SEO (optimización para buscadores)

La práctica de hacer un sitio localizable y posicionable en los buscadores clásicos. Es el cimiento sobre el que se apoya el GEO: una página que un motor no puede rastrear ni renderizar tampoco la puede citar.

Lo mismo que ↗

llms.txt

Un fichero de texto en la raíz del sitio que lista sus páginas para los modelos de lenguaje, en el espíritu de robots.txt o sitemap.xml. Es una convención propuesta, no un estándar: ningún motor grande se ha comprometido a leerlo.

Sin entidad externa todavíaEl que publica este sitio →

Schema.org

Un vocabulario compartido para describir las cosas de una página —una persona, un servicio, un artículo— de forma que una máquina las lea como entidades y no como texto decorado. Lo mantienen conjuntamente Google, Microsoft, Yahoo y Yandex.

Lo mismo que ↗

JSON-LD

El formato JSON que se usa para incrustar datos estructurados en una página como un bloque aparte, en vez de repartir atributos por el marcado. Es el formato que recomienda Google y el que usa este sitio.

Lo mismo que ↗

robots.txt

Un fichero en la raíz del sitio que indica a los clientes automáticos qué rutas pueden pedir. Una línea de más aquí es de las formas más baratas de volverse invisible: un rastreador de IA bloqueado no tiene nada tuyo que citar.

Lo mismo que ↗

Rastreador (crawler)

Un programa que pide páginas de forma automática para indexarlas o alimentar con ellas otro sistema. GPTBot, ClaudeBot y PerplexityBot son rastreadores; Google-Extended no lo es — es un token de robots.txt que gobierna el entrenamiento y el grounding, y no afecta a la Búsqueda de Google.

Lo mismo que ↗Lo que dice Google sobre Google-Extended →

LLM (modelo grande de lenguaje)

Un modelo entrenado con grandes cantidades de texto que predice el siguiente token. Lo que produce no es una consulta a hechos guardados, y por eso la misma pregunta hecha dos veces puede volver con fuentes distintas.

Lo mismo que ↗

RAG (generación aumentada por recuperación)

Recuperar documentos en el momento de responder y dárselos al modelo como contexto, para que la respuesta pueda citar fuentes en vez de depender sólo del entrenamiento. Es el mecanismo detrás de casi toda respuesta que muestra citas.

Lo mismo que ↗Un sistema RAG propio, en abierto →

Grafo de conocimiento

Una red de entidades y de las relaciones entre ellas, en vez de un saco de documentos. Declarar tus entidades con identificadores estables es lo que permite a una máquina distinguir tu marca de otra que se llame igual.

Lo mismo que ↗

Enlazado de entidades

Atar un nombre de una página a la cosa del mundo real a la que se refiere, mediante un identificador que una máquina pueda resolver. En Schema.org es para lo que sirve la propiedad sameAs — y es el motivo de que cada término de aquí que tenga una entidad real la enlace.

Lo mismo que ↗

Sitemap (mapa del sitio)

Un fichero XML que lista las URLs de un sitio con su fecha de última modificación, para que un rastreador no tenga que descubrirlas siguiendo enlaces. Declara lo que existe; no promete nada sobre posicionamiento.

Lo mismo que ↗

URL canónica

La dirección que una página declara como la suya oficial cuando el mismo contenido es alcanzable por varias vías. Sin ella, el mismo texto compitiendo consigo mismo reparte la señal que tuviera.

Lo mismo que ↗

Índice de Jaccard

Una medida de cuánto se solapan dos conjuntos, de 0 a 1. Es la medida que se usa para comparar qué fuentes cita un motor de respuesta entre dos ejecuciones idénticas — y el solape queda muy por debajo de 1, que es la razón de que una sola pasada no sea una medición.

Lo mismo que ↗El conjunto de datos de esa cifra →

Intervalo de confianza

El rango en el que se espera que caiga un valor medido, dado cuántas veces se midió. Un porcentaje publicado sin él —sin número de pasadas y sin dispersión— no es una medición; es una opinión con decimales.

Lo mismo que ↗

DOI (identificador de objeto digital)

Un identificador permanente para un documento o conjunto de datos que sigue resolviendo aunque el fichero cambie de sitio. Es lo que convierte un «lo medimos» en algo que un tercero puede descargar y comprobar años después.

Lo mismo que ↗Nuestras mediciones, con el suyo →