# Demandas por datos de entrenamiento de IA: qué implican para los «web scrapers»

En septiembre de 2025, un juez federal concedió la aprobación preliminar a un acuerdo de 1.500 millones de dólares, la mayor indemnización por derechos de autor en la historia de la IA. Las reclamaciones en las que se basa: Anthropic entrenó sus modelos con aproximadamente 500 000 libros pirateados (Copyright Alliance, «Participación en el acuerdo Bartz contra Anthropic», consultado el 17 de septiembre de 2026). Esa cifra por sí sola debería llamar la atención de cualquiera que se dedique a recopilar datos.

En los últimos dieciocho meses, los tribunales de dos continentes han comenzado a establecer límites claros sobre cómo las empresas de IA y los «scrapers» pueden adquirir datos de entrenamiento, y esos límites no siempre coinciden con lo que la industria daba por sentado. Este artículo repasa las principales sentencias, lo que realmente se ha dictaminado y qué cambios deben introducir los equipos de datos y los proveedores de infraestructura de «scraping» en su forma de operar. Para conocer los fundamentos técnicos, consulte [cómo funciona el web scraping](https://www.joinmassive.com/glossary/what-is-web-scraping).

> **Puntos clave**
> - El acuerdo extrajudicial de 1.500 millones de dólares de Anthropic demuestra que fue la piratería, y no el entrenamiento, lo que generó la responsabilidad (Copyright Alliance, 2026).
> - Ross Intelligence perdió su defensa basada en el uso legítimo porque su herramienta de IA competía directamente con el propio mercado de Westlaw; Anthropic y Meta nunca tuvieron que responder a esa cuestión.
> - Solo el 14 % de los dominios más importantes ha establecido una señal «robots.txt» para bots de IA (Cloudflare Radar, 2025).
> - La evasión le lleva a la lista negra. No hace falta ninguna demanda.

## ¿Qué dictaminan realmente los tribunales sobre los datos de entrenamiento de la IA?

Los tribunales dictaminan que la forma en que se adquieren los datos de entrenamiento puede generar una responsabilidad totalmente independiente de cómo se utilizan. El acuerdo en el caso Bartz contra Anthropic se desglosó en aproximadamente 3.000 dólares por obra, repartidos entre unos 500.000 libros pirateados, una cifra vinculada directamente al método de adquisición, no a cómo se utilizaron posteriormente los libros en el entrenamiento (Copyright Alliance, «Participación en el acuerdo Bartz contra Anthropic», consultado el 17 de septiembre de 2026).

![Filas de libros de derecho en las estanterías de la biblioteca de un juzgado, que representan el creciente corpus de jurisprudencia que da forma a las normas sobre los datos de entrenamiento de la IA.](https://cdn.pixabay.com/photo/2014/03/20/21/53/law-books-291683_1280.jpg)

La sentencia subyacente del juez William Alsup en el caso Bartz contra Anthropic trazó una línea divisoria muy clara que el sector no esperaba del todo. El entrenamiento con los libros que Anthropic había adquirido y escaneado constituía un uso legítimo, «espectacularmente transformador», en sus propias palabras (Norton Rose Fulbright, Inside Tech Law, «Bartz contra Anthropic: Acuerdo alcanzado tras una sentencia sumaria histórica», consultado el 17 de septiembre de 2026). La descarga de copias piratas para crear una biblioteca de investigación permanente constituía un acto distinto y no se consideraba uso legítimo, independientemente del uso que se le diera posteriormente a los datos.

Esa distinción reviste mayor importancia que la propia cuantía del acuerdo. La adquisición y el uso son ahora dos cuestiones jurídicas distintas, y una empresa puede salir ganando en una mientras que sale claramente perdedora en la otra. Anthropic llegó a un acuerdo extrajudicial en agosto de 2025, y el juez Alsup concedió la aprobación preliminar al mes siguiente (CNBC, «El juez concede la aprobación preliminar a un acuerdo de 1.5B dólares con los autores», 25 de septiembre de 2025, consultado el 17 de septiembre de 2026).

¿Acaso un laboratorio de IA bien financiado corre realmente menos riesgos legales que un pequeño «scraper» que utilice la misma fuente pirateada? No necesariamente. El acuerdo demuestra que la escala no protege a nadie frente a una reclamación por el método de adquisición, una vez que se ha establecido que este es independiente de la cuestión del uso legítimo. Véase [qué se considera datos de entrenamiento de IA](https://www.joinmassive.com/glossary/what-is-llm-training-data) para conocer los mecanismos subyacentes que estas sentencias están evaluando.

<!-- GRÁFICO 2: Cronología del acuerdo y las licencias -->
<figure data-max-width="640">
  <svg viewBox="0 0 560 380" style="max-width: 100%; height: auto; font-family: 'Outfit', system-ui, sans-serif" role="img" aria-label="Cronología de los acuerdos sobre derechos de autor en materia de IA de 2025: Anthropic acepta un acuerdo de 1.500 millones de dólares en el caso Bartz contra Anthropic en agosto de 2025, con la aprobación judicial preliminar en septiembre de 2025, a lo que le siguen el acuerdo de licencia de Universal Music Group con Udio en octubre de 2025 y los acuerdos de Warner Music Group con Udio y Suno en noviembre de 2025.»>
    <title>El giro de 2025: de los litigios a las licencias</title>
    <desc>Línea temporal horizontal que muestra cuatro acontecimientos relacionados con acuerdos sobre derechos de autor en materia de IA en 2025: Anthropic acepta un acuerdo de 1.500 millones de dólares en el caso Bartz contra Anthropic (agosto de 2025); el tribunal concede la aprobación preliminar (septiembre de 2025); Universal Music Group llega a un acuerdo con Udio y lanza una plataforma musical basada en IA con licencia (octubre de 2025); Warner Music Group llega a un acuerdo tanto con Udio como con Suno (noviembre de 2025).</desc>

    <text x="280" y="30" text-anchor="middle" font-size="15" font-weight="800" fill="currentColor">El giro de 2025: de los litigios a las licencias</text>
    <text x="280" y="50" text-anchor="middle" font-size="10.5" fill="currentColor" opacity="0.55">Principales acuerdos sobre derechos de autor relacionados con la IA, agosto-noviembre de 2025</text>

    <line x1="60" y1="190" x2="500" y2="190" stroke="currentColor" stroke-opacity="0.25" stroke-width="2" />

    <circle cx="100" cy="190" r="8" fill="#d74939" />
    <text x="100" y="150" text-anchor="middle" font-size="11" font-weight="700" fill="currentColor">Acuerdo por valor de 1.5B</text>
    <text x="100" y="165" text-anchor="middle" font-size="9,5" fill="currentColor" opacity="0,65">Bartz contra Anthropic</text>
    <text x="100" y="215" text-anchor="middle" font-size="10" font-family="'JetBrains Mono', monospace" fill="currentColor" opacity="0.6">Agosto de 2025</text>

    <circle cx="220" cy="190" r="8" fill="#ff8163" />
    <text x="220" y="225" text-anchor="middle" font-size="11" font-weight="700" fill="currentColor">Autorización judicial</text>
    <text x="220" y="240" text-anchor="middle" font-size="9.5" fill="currentColor" opacity="0.65">Se ha concedido la aprobación preliminar</text>
    <text x="220" y="165" text-anchor="middle" font-size="10" font-family="'JetBrains Mono', monospace" fill="currentColor" opacity="0.6">Septiembre de 2025</text>

    <circle cx="340" cy="190" r="8" fill="#d74939" />
    <text x="340" y="150" text-anchor="middle" font-size="11" font-weight="700" fill="currentColor">Acuerdo entre UMG y Udio</text>
    <text x="340" y="165" text-anchor="middle" font-size="9,5" fill="currentColor" opacity="0,65">Plataforma musical con IA bajo licencia</text>
    <text x="340" y="215" text-anchor="middle" font-size="10" font-family="'JetBrains Mono', monospace" fill="currentColor" opacity="0.6">Octubre de 2025</text>

 <circle cx="460" cy="190" r="8" fill="#ff8163" />
    <text x="460" y="225" text-anchor="middle" font-size="11" font-weight="700" fill="currentColor">WMG resuelve ambos casos</text>
    <text x="460" y="240" text-anchor="middle" font-size="9.5" fill="currentColor" opacity="0.65">Udio y, a continuación, Suno</text>
    <text x="460" y="165" text-anchor="middle" font-size="10" font-family="'JetBrains Mono', monospace" fill="currentColor" opacity="0.6">Noviembre de 2025</text>

    <text x="280" y="372" text-anchor="middle" font-size="10" fill="currentColor" opacity="0.35">Fuente: Copyright Alliance; CNBC; Music Business Worldwide (2025)</text>
  </svg>
  <figcaption>El giro de 2025: de los litigios sobre derechos de autor relacionados con la IA a acuerdos extrajudiciales y concesión de licencias (Fuente: Copyright Alliance, CNBC, Music Business Worldwide, 2025)</figcaption>
</figure>

## ¿Por qué Thomson Reuters se impuso a Ross Intelligence cuando Anthropic ganó por el uso legítimo?

Thomson Reuters ganó porque Ross Intelligence desarrolló un producto directamente competidor a partir de contenidos con licencia que no estaba autorizada a utilizar para el entrenamiento. En febrero de 2025, el juez Stephanos Bibas (D. Del.) dictó sentencia sumaria parcial a favor de Thomson Reuters, lo que supuso la primera derrota en un fallo sumario para una empresa de IA en una defensa basada en el uso legítimo de datos de entrenamiento (Goodwin Procter, «El tribunal rechaza la defensa basada en el uso legítimo en un caso de derechos de autor sobre IA», consultado el 17 de septiembre de 2026).

Ross había utilizado los resúmenes jurisprudenciales de Westlaw —contenido editorial que Thomson Reuters había tardado décadas en crear— para entrenar una herramienta de investigación jurídica que competía directamente con la propia Westlaw. El juez Bibas consideró que dicho uso no era transformador y resultaba perjudicial desde el punto de vista comercial para el mercado de la obra original (Jenner & Block, alerta al cliente, consultado el 17 de septiembre de 2026).

Compárese esto con el caso Kadrey contra Meta. En junio de 2025, el juez Vince Chhabria (Distrito Norte de Cal.) concedió a Meta una sentencia sumaria parcial sobre el uso legítimo, a pesar de que algunos libros de entrenamiento procedían de bibliotecas paralelas, ya que los demandantes no pudieron demostrar que el uso de Meta diluyera el mercado de su obra (Goodwin Procter, consultado el 17 de septiembre de 2026). Tuvo cuidado de señalar que un futuro demandante que pudiera demostrar la dilución del mercado podría ganar donde estos demandantes no lo hicieron (Copyright Alliance, «Kadrey contra Meta: sentencia», consultado el 17 de septiembre de 2026).

Entonces, ¿qué es lo que realmente distingue una defensa exitosa basada en el uso legítimo de una que fracasa? Resulta que es la competencia en el mercado, y no los mecanismos de la copia en sí misma.

<!-- [PERSPECTIVA ÚNICA] -->
Leídas en su conjunto, estas sentencias sugieren que el método de adquisición y el uso competitivo funcionan como dos vías de responsabilidad independientes. Anthropic perdió en cuanto a la adquisición (piratería) a pesar de ganar en cuanto al uso transformador. Ross perdió en cuanto al uso competitivo a pesar de basarse en contenido de origen con licencia. Ninguno de los dos factores garantiza por sí solo la protección.

<!-- TABLA 1: Comparación de resultados sobre el uso legítimo (tabla HTML -> htmlEmbed) -->
<table>
  <thead>
    <TR>
 <TH>Caso</TH>
 <TH>Sobre qué se realizó el entrenamiento</TH>
 <TH>Cómo se obtuvieron los datos</TH>
 <TH>¿Compite con la fuente?</TH>
 <TH>Resultado del uso legítimo</TH>
    </TR>
  </THEAD>
  <tbody>
    <tr>
 <td><strong>Bartz contra Anthropic</strong></td>
 <td>Libros, adquiridos y escaneados</td>
 <td>Copias adquiridas legalmente (lícitas) más copias piratas procedentes de «bibliotecas en la sombra» (ilícitas)</td>
      <td>No</td>
 <td>Entrenamiento con libros adquiridos: uso legítimo. Descarga de copias piratas: no constituye uso legítimo, lo que dio lugar a un acuerdo extrajudicial de 1.5B dólares</td>
    </tr>
    <tr>
 <td><strong>Kadrey contra Meta</strong></td>
 <td>Libros, incluidos los procedentes de bibliotecas paralelas</td>
 <td>Parcialmente pirateados</td>
 <td>Los demandantes no demostraron perjuicio al mercado</td>
      <td>Uso legítimo según este expediente; el juez dejó la puerta abierta a los demandantes que puedan demostrar una dilución del mercado</td>
    </tr>
    <tr>
 <td><strong>Thomson Reuters contra Ross Intelligence</strong></td>
      <td>Resúmenes de Westlaw</td>
 <td>Contenido con licencia, utilizado sin autorización para el entrenamiento</td>
 <td>Sí, un producto competidor de investigación jurídica</td>
 <td>No se trata de uso legítimo; la primera derrota en un fallo sumario sobre el entrenamiento de la IA</td>
    </tr>
    <tr>
 <td><strong>Getty Images contra Stability AI (Reino Unido)</strong></td>
 <td>Imágenes de archivo con licencia</td>
 <td>Utilizadas sin licencia; la formación se llevó a cabo fuera del Reino Unido</td>
      <td>Sí, un negocio competidor de concesión de licencias de imágenes</td>
 <td>Reclamación por derechos de autor desestimada por motivos jurisdiccionales; en su lugar, se constató una infracción de marca registrada</td>
    </tr>
  </tbody>
</table>

## Los casos que aún se encuentran en trámite judicial

Varios de los casos más importantes sobre derechos de autor relacionados con la IA siguen sin resolverse, y sus resultados podrían redefinir aún más la doctrina del uso legítimo. Las demandas consolidadas del NYT y del Authors Guild contra OpenAI se tramitan ahora en el caso «In re OpenAI Copyright Litigation», ante el juez Sidney Stein. A fecha de septiembre de 2026, el caso se encuentra en fase de presentación de pruebas, sin que se haya fijado fecha para el juicio (Washington Post, «El Departamento de Justicia insta al juez a fallar a favor de OpenAI y Microsoft en la demanda del NY Times», 2 de septiembre de 2026, consultado el 17 de septiembre de 2026).

![Estanterías en el interior de una biblioteca, que representan los numerosos casos pendientes sobre derechos de autor relacionados con la IA que se encuentran en fase de presentación de pruebas y apelación.](https://cdn.pixabay.com/photo/2016/01/19/01/42/library-1147815_1280.jpg)

El juez Stein desestimó en gran medida la solicitud de desestimación presentada por OpenAI y Microsoft en abril de 2025, permitiendo que prosiguieran la mayoría de las reclamaciones y rechazando explícitamente calificar el entrenamiento de la IA como «intrínsecamente transformador». Una resolución del 27 de octubre de 2025 fue aún más lejos: El juez Stein sostuvo que los resúmenes de la trama de las novelas de los demandantes generados por ChatGPT podrían constituir en sí mismos una infracción, una teoría de los «resultados» distinta de la cuestión del entrenamiento (IPWatchdog, «OpenAI pierde su intento de desestimar una demanda colectiva multidistrital sobre los resultados de ChatGPT,», 28 de octubre de 2025, consultado el 17 de septiembre de 2026).

El caso también ha suscitado interés fuera de los tribunales. El 2 de septiembre de 2026, el Departamento de Justicia presentó un escrito instando al tribunal a fallar a favor de OpenAI y Microsoft (Washington Post, consultado el 17 de septiembre de 2026; Axios, «Demanda por derechos de autor entre el NYT, OpenAI y Microsoft», 8 de septiembre de 2026, consultado el 17 de septiembre de 2026).

El caso Getty Images contra Stability AI se dividió por un océano. El 4 de noviembre de 2025, el Tribunal Superior del Reino Unido dictaminó que la reclamación de derechos de autor de Getty no prosperaba porque el entrenamiento de Stability se había llevado a cabo fuera del Reino Unido, pero sí constató una infracción de marca registrada, ya que los primeros resultados de Stable Diffusion llevaban la marca de agua de Getty (Ropes & Gray, consultado el 17 de septiembre de 2026). El caso independiente de Getty en EE. UU., presentado de nuevo en el Distrito Norte de California, superó en abril de 2026 una moción de desestimación relativa a las reclamaciones por marcas registradas y dilución, y el juicio está previsto para enero-febrero de 2028 (expediente de CourtListener, consultado el 17 de septiembre de 2026).

<!-- [PERSPECTIVA ÚNICA] -->
La misma teoría —según la cual los resultados generados por la IA que llevan la marca de agua de una marca o contenido derivado reconocible constituyen una infracción— se está aplicando actualmente de forma simultánea en los tribunales del Reino Unido y de EE. UU. Las reclamaciones por derechos de autor se están reduciendo por motivos jurisdiccionales y de uso transformativo, pero las reclamaciones relacionadas con marcas registradas y con los resultadosestán llenando el vacío que dejan esas sentencias más restrictivas.

Esta tendencia va más allá del texto. Disney, Universal y Warner Bros. demandaron a Midjourney entre junio y septiembre de 2025 por la generación de imágenes, y los casos consolidados siguen en fase de disputa sobre la presentación de pruebas a mediados de 2026 (Variety, consultado el 17 de septiembre de 2026; IPWatchdog, «La demanda de Warner Bros. alega que la infracción de derechos de autor por parte de Midjourney es “sistemática” «deliberada»», consultado el 17 de septiembre de 2026). En el ámbito musical, Universal Music Group llegó a un acuerdo con Udio en octubre de 2025, combinando una indemnización con un acuerdo de licencia para una nueva plataforma musical basada en IA, y Warner Music llegó a un acuerdo tanto con Udio como con Suno en noviembre de 2025 (Music Business Worldwide, consultado el 17 de septiembre de 2026). Sony sigue inmersa en litigios con ambas plataformas. La presión tampoco se limita a los tribunales: véase [por qué cada vez es más difícil acceder a los datos de la web](https://www.joinmassive.com/blog/why-ai-agents-get-blocked-on-datacenter-ips-and-how-to-fix-it) para conocer el aspecto relacionado con la infraestructura de esta misma presión.

## ¿Se aplica algo de esto a la extracción de datos públicos, y no solo al entrenamiento de la IA?

La extracción de datos de páginas web de acceso público no constituye, en sí misma, un delito federal, pero eso no significa que esté exenta de riesgos. El caso hiQ Labs contra LinkedIn zanjó esta cuestión en el Noveno Circuito: la extracción de datos de páginas públicas no incumple la disposición de la CFAA relativa a la «acceso sin autorización» de la CFAA, aunque siguen siendo plenamente aplicables las reclamaciones por incumplimiento de contrato, derechos de autor y intrusión (White & Case, «Web scraping, website terms and the CFAA», consultado el 17 de septiembre de 2026).

Dicha sentencia se dictó tras la remisión del caso, después de que la decisión del Tribunal Supremo en el asunto Van Buren redujera el alcance de la CFAA. En el mismo procedimiento también se determinó que hiQ seguía incumpliendo las Condiciones de servicio de LinkedIn, una reclamación contractual independiente que no se veía afectada por el fallo de la CFAA (Fenwick & West, «hiQ Labs se sale con la suya de nuevo», consultado el 17 de septiembre de 2026). En la práctica, la verdadera cuestión de riesgo pasó de ser «¿se trata de piratería informática?» a «¿tenía permiso o una licencia?».

Si la extracción de datos de páginas públicas no es piratería informática, ¿por qué se sigue bloqueando y demandando a las empresas por ello? Porque la inmunidad de la CFAA nunca ha abarcado las reclamaciones contractuales, de derechos de autor o por intrusión, y es precisamente ahí donde se centran ahora la mayoría de los litigios.

Un incidente independiente ocurrido en agosto de 2025 demostró la rapidez con la que pueden actuar las medidas informales de aplicación de la ley. Cloudflare informó de que Perplexity utilizaba agentes de usuario y ASN no declarados y rotativos para seguir rastreando dominios de prueba que habían prohibido explícitamente el acceso a todos los rastreadores a través del archivo robots.txt (Search Engine Journal, «Cloudflare elimina de su lista y bloquea a Perplexity de rastrear sitios web», consultado el 17 de septiembre de 2026). Cloudflare retiró a Perplexity su estatus de bot verificado y bloqueó su rastreador en toda la red, sin necesidad de presentar ninguna demanda judicial.

<div data-block="callout" data-tone="warning">
**Las tácticas de evasión de identidad conllevan sus propios riesgos, al margen de cualquier litigio.** Las conclusiones de Cloudflare de agosto de 2025 sobre Perplexity demuestran que los proveedores de infraestructura pueden eliminar de la lista y poner en la lista negra a un rastreador en toda la red en el momento en que detecten agentes de usuario rotativos o ASN utilizados para eludir un bloqueo declarado en el archivo robots.txt, sin necesidad de demanda judicial (Search Engine Journal, consultado el 17 de septiembre de 2026).
</div>

Perplexity rebatió públicamente la descripción que hizo Cloudflare de los hechos (Search Engine Journal, consultado el 17 de septiembre de 2026). Independientemente de cómo se resuelva dicha controversia, la lección es clara: ser sorprendido eludiendo un bloqueo declarado puede poner fin de la noche a la mañana al acceso de un rastreador a gran parte de la web. Para conocer con más detalle cuáles son los límites legales, consulte [prácticas éticas de web scraping](https://www.joinmassive.com/blog/ethical-web-scraping).

## Cómo están respondiendo los proveedores de infraestructura

Los proveedores de infraestructura dejaron de esperar a los tribunales y comenzaron a modificar ellos mismos los ajustes predeterminados. A partir del 1 de julio de 2025, Cloudflare estableció el bloqueo de los rastreadores de IA no autorizados como configuración predeterminada para todos los dominios nuevos, pasando del modelo anterior de «bloqueo por aceptación» a uno de «acceso por exclusión» (Cloudflare, comunicado de prensa, «Cloudflare acaba de cambiar la forma en que los rastreadores de IA recopilan datos de Internet en general», consultado el 17 de septiembre de 2026).

Cloudflare acompañó ese cambio con «Pay Per Crawl», un mecanismo que permite a los propietarios de sitios web cobrar a los rastreadores por el acceso, y que, según la empresa, evolucionará hacia «Pay Per Use» a partir del 15 de septiembre de 2026, bloqueando de forma predeterminada los rastreadores de doble finalidad en las páginas financiadas con publicidad (Blog de Cloudflare, consultado el 17 de septiembre de 2026). En un periodo de tráfico comprendido entre el 19 y el 26 de junio de 2025, Cloudflare Radar descubrió que el rastreador de Anthropicrealizó aproximadamente 71 000 solicitudes de páginas HTML por cada referencia que devolvió a los sitios que rastreó (Blog de Cloudflare/Radar, «Relación entre rastreos y referencias de la IA en Radar», consultado el 17 de septiembre de 2026).

<!-- GRÁFICO 3: Brecha en la adopción de robots.txt por parte de los bots de IA (gráfico de anillo) -->
<figure data-max-width="640">
  <svg viewBox="0 0 560 380" style="max-width: 100%; height: auto; font-family: 'Outfit', system-ui, sans-serif" role="img" aria-label="Gráfico de rosquilla: solo el 14 % de los 10 000 principales dominios web ha establecido alguna directiva específica para bots de IA en el archivo robots.txt, mientras que el 86 % no tiene ninguna señal relacionada con los bots de IA, según los datos de Cloudflare Radar de junio de 2025.">
    <title>La mayoría de los sitios web aún no cuenta con un</title>
    <desc>Gráfico de donut que muestra que, de los 10 000 dominios web más importantes que cuentan con un archivo robots.txt, solo el 14 % tiene alguna directiva específica para bots de IA; el 86 % carece de señal para bots de IA. Fuente: Cloudflare Radar, junio de 2025.</desc>

    <text x="280" y="30" text-anchor="middle" font-size="15" font-weight="800" fill="currentColor">La mayoría de los sitios web aún no han establecido ninguna señal para los bots de IA</text>
    <text x="280" y="50" text-anchor="middle" font-size="10.5" fill="currentColor" opacity="0.55">Porcentaje de los 10 000 dominios principales que cuentan con una directiva para bots de IA en el archivo robots.txt</text>

    <path d="M 280,55 A 100,100 0 0 1 357.1,91,3 L 324,7,118,0 A 58,58 0 0 0 280,97 Z" fill="#d74939" />
    <path d="M 357,1,91,3 A 100,100 0 1 1 280,55 L 280,97 A 58,58 0 1 0 324,7,118,0 Z" fill="#64748b" opacity="0,45" />

 <text x="280" y="150" text-anchor="middle" font-size="34" font-weight="800" fill="#d74939">14 %</text>
    <text x="280" y="168" text-anchor="middle" font-size="10" fill="currentColor" opacity="0.65">dispone de un bot de IA</text>
    <text x="280" y="181" text-anchor="middle" font-size="10" fill="currentColor" opacity="0.65">señal de robots.txt</text>

 <rect x="150" y="298" width="14" height="14" fill="#d74939" />
    <text x="172" y="309" font-size="11" fill="currentColor" opacity="0.85">14 %: establecer una directiva en el archivo robots.txt específica para el bot de IA</text>

    <rect x="150" y="322" width="14" height="14" fill="#64748b" opacity="0.45" />
    <text x="172" y="333" font-size="11" fill="currentColor" opacity="0.85">86 %: no se ha establecido ninguna señal para los bots de IA</text>

    <text x="280" y="372" text-anchor="middle" font-size="10" fill="currentColor" opacity="0.35">Fuente: Cloudflare Radar (junio de 2025)</text>
  </svg>
  <figcaption>Solo el 14 % de los 10 000 dominios principales ha establecido una directiva robots.txt específica para bots de IA (Fuente: Cloudflare Radar, junio de 2025)</figcaption>
</figure>

La mayoría de los propietarios de sitios web aún no han establecido ninguna señal. GPTBot fue el rastreador más bloqueado en ese mismo conjunto de datos, rechazado por 312 de los 3.816 dominios que contaban con un archivo robots.txt, frente a solo 61 que lo permitían explícitamente (Blog/Radar de Cloudflare, consultado el 17 de septiembre de 2026).

Las autoridades reguladoras están empezando a considerar que las señales legibles por máquina son las únicas que cuentan. El 10 de diciembre de 2025, el Tribunal Regional Superior Hanseático de Hamburgo dictaminó en el caso Kneschke contra LAION (OLG Hamburgo, 5 U 104/24) que una exclusión de la extracción de datos en formato de texto yminería de datos solo es legalmente efectiva si es legible por máquina. El archivo «robots.txt», un encabezado X-Robots-Tag o el Protocolo de Reserva de TDM son válidos. Una cláusula oculta en los términos y condiciones de un sitio web redactados en lenguaje natural no lo es (Norton Rose Fulbright, Inside Tech Law, «Exclusiones legítimas legibles por máquina y entrenamiento de la IA: El Tribunal de Hamburgo aclara las excepciones a los derechos de autor», consultado el 17 de septiembre de 2026).

Este enfoque se ajusta al Código de buenas prácticas de la GPAI de la UE, publicado en julio de 2025 y firmado por 23 desarrolladores de IA hasta julio de 2026, entre los que se incluyen OpenAI, Google, Anthropic y Microsoft, todos los cuales se comprometieron a realizar el rastreo con bots que respeten el archivo robots.txt y a respetar las reservas legibles por máquina.

<!-- [PERSPECTIVA ÚNICA] -->
Los proveedores de infraestructura y los reguladores están, de hecho, adelantándose a los tribunales en este ámbito. Cloudflare modificó su política predeterminada de rastreo en julio de 2025, y la norma sobre señales legibles por máquina del tribunal de Hamburgo se estableció mucho antes de que la jurisprudencia estadounidense resolviera cuestiones comparables sobre la extracción de datos y las licencias. Los equipos que esperen a que se resuelvan los litigios antes de ajustar su política pueden encontrarse con que los valores por defecto ya han cambiado sin que se hayan dado cuenta.

## Qué deben hacer ahora los rastreadores y los equipos de datos

Los equipos de datos que tratan la procedencia como una cuestión secundaria son los más expuestos a los riesgos que han generado estas sentencias. Solo el acuerdo de Bartz supuso un coste aproximado de 3.000 dólares por obra pirateada, repartidos entre unos 500.000 libros (Copyright Alliance, consultado el 17 de septiembre de 2026), una cifra que cualquier equipo jurídico puede multiplicar por su propio archivo sin licencia.

**1. Realice un seguimiento de la procedencia de los datos de principio a fin.** Sepa exactamente de dónde procede cada dato de entrenamiento o de la colección, y si se obtuvo mediante licencia, se adquirió o se extrajo mediante scraping. El caso Anthropic demuestra que los reguladores y los tribunales separarán el método de adquisición del uso posterior a la hora de asignar la responsabilidad.

**2. Respete las señales de exclusión legibles por máquina.** Los archivos robots.txt, ai.txt y el Protocolo de Reserva TDM son los estándares que los reguladores reconocen actualmente, incluso en aquellas jurisdicciones en las que aún no se ha impuesto esta obligación.

**3. Dé prioridad a las licencias frente a los atajos que rozan la piratería.** Las relaciones con datos adquiridos o bajo licencia se sostienen ante los tribunales de una forma en que los archivos pirateados no lo hacen, ya que la victoria de Anthropic por «uso legítimo» en el caso de los libros adquiridos no sirvió para eximirle de su responsabilidad por las copias pirateadas que se encontraban junto a ellos en la misma sesión de entrenamiento.

**4. Evite las tácticas de evasión de identidad.** Alternar los agentes de usuario para eludir un bloqueo declarado le llevará a la lista negra. No hace falta presentar ninguna demanda judicial. La información sobre [lo que realmente implica la extracción de datos mediante IA](https://www.joinmassive.com/glossary/what-is-ai-scraping) es un punto de partida útil para auditar su propio proceso.

![El mazo de un juez apoyado sobre una superficie de madera, que simboliza las sentencias judiciales que ahora determinan cómo los equipos de datos obtienen y obtienen licencias para los datos de entrenamiento.](https://cdn.pixabay.com/photo/2022/10/05/07/10/gavel-7499921_1280.jpg)

<div data-block="cta" data-text="La procedencia es una pieza más de una postura defendible en la obtención de datos, no el panorama completo. La red de proxies residenciales de Massive funciona en dispositivos de usuarios reales en más de 195 países, cada uno de ellos inscrito a través del SDK de Massive, y proporciona código HTML o Markdown limpio procedente de cualquier fuente pública en cualquier ubicación. Cuenta con la auditoría SOC 2 y cumple con el RGPD, lo que constituye un elemento más de una estrategia de obtención de datos defendible, pero no un escudo legal ni un sustituto del asesoramiento jurídico."></DIV>

### ¿Es ilegal extraer datos de sitios web de acceso público?

No de por sí. El Noveno Circuito dictaminó en el caso hiQ Labs contra LinkedIn que la extracción de datos de páginas de acceso público no infringe la CFAA (White & Case, consultado el 17 de septiembre de 2026). No obstante, las reclamaciones por incumplimiento de contrato, de derechos de autor y de usurpación de bienes muebles siguen siendo plenamente aplicables, por lo que quien realice el scraping puede seguir enfrentándose a una responsabilidad real sin infringir esa ley en concreto. Consulte [cómo proporcionar a los agentes de IA acceso en tiempo real a la web](https://www.joinmassive.com/blog/how-to-give-ai-agents-live-web-access) para conocer los aspectos relacionados con el archivo robots.txt y el acceso de los rastreadores.

### ¿Se considera uso legítimo el entrenamiento de un modelo de IA con material protegido por derechos de autor?

Depende de la adquisición y la competencia, no solo de la transformación. El juez Alsup dictaminó que el entrenamiento con libros adquiridos constituía uso legítimo en el caso Anthropic, mientras que el juez Bibas dictaminó que el entrenamiento de Ross Intelligence con los resúmenes de Westlaw para un producto competidor no lo era, lo que supuso la primera derrota de este tipo (Goodwin Procter, consultado el 17 de septiembre de 2026).

### ¿Cuál es la diferencia entre las sentencias sobre derechos de autor en materia de IA de los casos Anthropic y Thomson Reuters?

Anthropic ganó en lo relativo al entrenamiento transformativo, pero perdió en lo relativo a la piratería, lo que dio lugar a un acuerdo extrajudicial de 1.500 millones de dólares por unos 500.000 libros pirateados (Copyright Alliance, consultado el 17 de septiembre de 2026). Ross Intelligence perdió rotundamente porque utilizó contenido con licencia de Westlaw para crear un producto directamente competidor, un resultado relacionado con la competencia en el mercado más que con el método de entrenamiento en sí mismo.

### ¿Cómo pueden los equipos de datos reducir el riesgo legal al recopilar datos de entrenamiento?

Realice un seguimiento de la procedencia de cada entrada, respete las señales de exclusión legibles por máquina, como robots.txt y el Protocolo de Reserva TDM, y dé prioridad a los datos con licencia o adquiridos frente a atajos relacionados con la piratería. Cloudflare descubrió que solo alrededor del 14 % de los principales dominios habían configurado alguna señal robots.txt para bots de IA a fecha de junio de 2025 (Cloudflare Radar, consultado el 17 de septiembre de 2026), lo que deja la mayor parte de la exposición sin abordar por defecto.

## Conclusión

El panorama jurídico de los datos de entrenamiento de la IA se ha dividido este año en dos vías distintas: cómo se adquieren los datos y cómo se utilizan, y los tribunales están ahora dispuestos a sancionar los incumplimientos en cualquiera de ellas de forma independiente.

- El método de adquisición constituye ahora una vía de responsabilidad propia, independiente del uso legítimo.
- El uso competitivo acaba con la defensa del uso legítimo más rápidamente que la piratería: Ross Intelligence perdió rotundamente porque su herramienta competía directamente con Westlaw, una prueba a la que Anthropic y Meta nunca tuvieron que enfrentarse.
- La infraestructura avanza más rápido que los tribunales. Cloudflare modificó la configuración predeterminada de su rastreador en julio de 2025; los reguladores de la UE hicieron lo propio meses después.

Cabe esperar más acuerdos de «acuerdo extrajudicial más concesión de licencia», como los de UMG y Warner Music, a lo largo de 2027, ya que el patrón de «demandar y luego conceder la licencia» sigue extendiéndose al ámbito del texto, la imagen y la música. En cuanto al aspecto práctico de la obtención de datos de forma defendible, véase [cómo crear un canal de datos a partir de datos web en tiempo real](https://www.joinmassive.com/blog/building-a-rag-pipeline-on-live-web-data-without-stale-indexes).

## Fuentes

1. [Copyright Alliance, «Participación en el acuerdo Bartz contra Anthropic», consultado el 17 de septiembre de 2026](https://copyrightalliance.org/participating-bartz-v-anthropic-settlement/)
2. [CNBC, «El juez concede su visto bueno preliminar a un acuerdo de 1.500 millones de dólares con los autores», consultado el 17 de septiembre de 2026](https://www.cnbc.com/2025/09/25/judge-anthropic-case-preliminary-ok-to-1point5b-settlement-with-authors.html)
3. [Norton Rose Fulbright / Inside Tech Law, «Bartz contra Anthropic: se alcanza un acuerdo tras una sentencia sumaria histórica y la certificación de la demanda colectiva», consultado el 17 de septiembre de 2026](https://www.insidetechlaw.com/blog/2025/09/bartz-v-anthropic-settlement-reached-after-landmark-summary-judgment-and-class-certification)
4. [Goodwin Procter, «El tribunal rechaza la defensa basada en el uso legítimo en un caso de derechos de autor relacionado con la IA», consultado el 17 de septiembre de 2026](https://www.goodwinlaw.com/en/insights/publications/2025/02/alerts-practices-ip-lit-court-rejects-fair-use-defense-in-ai-copyright-case)
5. [Jenner & Block, alerta a clientes sobre el caso Thomson Reuters contra Ross Intelligence, consultado el 17 de septiembre de 2026](https://www.jenner.com/en/news-insights/client-alerts/court-decides-that-use-of-copyrighted-works-in-ai-training-is-not-fair-use-thomson-reuters-enterprise-centre-gmbh-v-ross-intelligence-inc)
6. [Goodwin Procter, «Fallo de un juez del Distrito Norte de California» (Kadrey contra Meta), consultado el 17 de septiembre de 2026](https://www.goodwinlaw.com/en/insights/publications/2025/06/alerts-practices-aiml-northern-district-of-california-judge-rules)
7. [Copyright Alliance, «Sentencia en el caso Kadrey contra Meta», consultado el 17 de septiembre de 2026](https://copyrightalliance.org/kadrey-v-meta-decision/)
8. [Washington Post, «El Departamento de Justicia insta al juez a fallar a favor de OpenAI y Microsoft en la demanda contra el New York Times», consultado el 17 de septiembre de 2026](https://www.washingtonpost.com/technology/2026/09/02/doj-urges-judge-rule-openai-microsoft-ny-times-lawsuit/)
9. [Axios, «Demanda por derechos de autor entre el NYT, OpenAI y Microsoft», consultado el 17 de septiembre de 2026](https://www.axios.com/2026/09/08/nyt-openai-microsoft-copyright-lawsuit)
10. [IPWatchdog, «OpenAI pierde su intento de desestimar una demanda colectiva multidistrital por los resultados de ChatGPT», consultado el 17 de septiembre de 2026](https://ipwatchdog.com/2025/10/28/openai-loses-bid-dismiss-multi-district-class-action-chatgpt-outputs/)
11. [Ropes & Gray, «Getty Images pierde la demanda por infracción de derechos de autor contra Stability AI en el primer caso del Reino Unido...», consultado el 17 de septiembre de 2026](https://www.ropesgray.com/en/insights/viewpoints/102lvxe/getty-image-loses-copyright-infringement-claim-against-stability-ai-in-uks-first)
12. [Cleary Gottlieb, «El Tribunal Superior del Reino Unido dicta una sentencia histórica en el caso Getty Images contra Stability AI», consultado el 17 de septiembre de 2026](https://www.clearyiptechinsights.com/2025/11/uk-high-court-issues-landmark-ruling-in-getty-images-v-stability-ai-with-narrow-trademark-infringement-win-for-getty-claim-of-secondary-copyright-infringement-fails/)
13. [CourtListener, expediente del caso Getty Images (EE. UU.) Inc. contra Stability AI Ltd., consultado el 17 de septiembre de 2026](https://www.courtlistener.com/docket/71112094/getty-images-us-inc-v-stability-ai-ltd/)
14. [Music Business Worldwide, «Universal Music llega a un acuerdo en la demanda contra Udio y firma un pacto para una plataforma musical con IA bajo licencia», consultado el 17 de septiembre de 2026](https://www.musicbusinessworldwide.com/universal-music-settles-udio-lawsuit-strikes-deal-for-licensed-ai-music-platform/)
15. [Hollywood Reporter, «Universal Music Group anuncia un acuerdo con Udio», consultado el 17 de septiembre de 2026](https://www.hollywoodreporter.com/music/music-industry-news/universal-music-group-announces-settlement-with-udio-1236414023/)
16. [Variety, sobre el litigio relativo a la presentación de pruebas de Midjourney Studios, consultado el 17 de septiembre de 2026](https://variety.com/2026/film/news/midjourney-studios-ai-copyright-discovery-1236800902/)
17. [IPWatchdog, «La demanda de Warner Bros. alega que la infracción de los derechos de autor por parte de Midjourney es “sistemática” y “deliberada”», consultado el 17 de septiembre de 2026](https://ipwatchdog.com/2025/09/08/warner-bros-complaint-alleges-midjourneys-copyright-infringement-systematic-willful/)
18. [White & Case, «Web scraping, condiciones de uso de los sitios web y la CFAA: se confirma de nuevo la medida cautelar de hiQ», consultado el 17 de septiembre de 2026](https://www.whitecase.com/insight-our-thinking/web-scraping-website-terms-and-cfaa-hiqs-preliminary-injunction-affirmed-again)
19. [Fenwick & West, «hiQ Labs se sale con la suya de nuevo: el Noveno Circuito reafirma que el scraping de datos no infringe la CFAA», consultado el 17 de septiembre de 2026](https://www.fenwick.com/insights/publications/hiq-labs-scrapes-by-again-the-ninth-circuit-reaffirms-that-data-scraping-does-not-violate-the-cfaa-1)
20. [Blog/Radar de Cloudflare, «Proporción de rastreo frente a referencias de la IA en Radar», consultado el 17 de septiembre de 2026](https://blog.cloudflare.com/ai-search-crawl-refer-ratio-on-radar/)
21. [Cloudflare, comunicado de prensa, «Cloudflare acaba de cambiar la forma en que los rastreadores de IA extraen datos de Internet en general», consultado el 17 de septiembre de 2026](https://www.cloudflare.com/press/press-releases/2025/cloudflare-just-changed-how-ai-crawlers-scrape-the-internet-at-large/)
22. [Search Engine Journal, «Cloudflare elimina de su lista y bloquea a Perplexity para que no rastree sitios web», consultado el 17 de septiembre de 2026](https://www.searchenginejournal.com/cloudflare-delists-and-blocks-perplexity-from-crawling-websites/552899/)
23. [Norton Rose Fulbright, Inside Tech Law, «Exclusiones legibles por máquina y entrenamiento de la IA: un tribunal de Hamburgo aclara las excepciones a los derechos de autor», consultado el 17 de septiembre de 2026](https://www.insidetechlaw.com/blog/2025/12/machine-readable-opt-outs-and-ai-training-hamburg-court-clarifies-copyright-exceptions)
