Filas de libros de derecho de tapa dura en las estanterías de una biblioteca, encerradas tras una verja de hierro forjado cerrada con llave, que representan el contenido restringido y sujeto a licencia en los litigios sobre los datos de entrenamiento de la IA.
Todas las entradas

Demandas relacionadas con los datos de entrenamiento de la IA: qué implican para los «web scrapers»

Ryan Turner
Ryan Turner · Head of Innovation
Abrir markdown

En septiembre de 2025, un juez federal concedió la aprobación preliminar a un acuerdo por valor de 1.500 millones de dólares, la mayor indemnización por derechos de autor en la historia de la inteligencia artificial. Los motivos de la demanda: Anthropic entrenó sus modelos con aproximadamente 500 000 libros pirateados (Copyright Alliance, «Participación en el acuerdo Bartz contra Anthropic», consultado el 17 de septiembre de 2026). Esa cifra por sí sola debería llamar la atención de cualquier persona que se dedique profesionalmente a la recopilación de datos.

En los últimos dieciocho meses, los tribunales de dos continentes han comenzado a establecer límites claros sobre cómo las empresas de inteligencia artificial y los «scrapers» pueden obtener datos de entrenamiento, y dichos límites no siempre coinciden con lo que el sector daba por sentado. En este artículo se repasan las principales sentencias, lo que realmente han dictaminado y qué cambios deben introducir los equipos de datos y los proveedores de infraestructura de «scraping» en su forma de operar. Para conocer los antecedentes sobre los mecanismos, consulte Cómo funciona el web scraping.

Puntos clave
  • El acuerdo de 1.500 millones de dólares de Anthropic demuestra que fue la piratería, y no la formación, lo que generó la responsabilidad (Copyright Alliance, 2026).
  • Ross Intelligence perdió su defensa basada en el uso legítimo porque su herramienta de inteligencia artificial competía directamente con el propio mercado de Westlaw; Anthropic y Meta nunca tuvieron que responder a esa pregunta.
  • Solo el 14 % de los dominios más importantes ha configurado una señal «robots.txt» para los bots de IA (Cloudflare Radar, 2025).
  • La evasión fiscal le lleva a la lista negra. No hace falta ninguna demanda.

¿Qué están dictaminando realmente los tribunales sobre los datos de entrenamiento de la IA?

Los tribunales están dictaminando que la forma en que se obtienen los datos de entrenamiento puede dar lugar a una responsabilidad totalmente independiente de cómo se utilizan. El acuerdo alcanzado en el caso Bartz contra Anthropic supuso un importe aproximado de 3.000 dólares por obra, repartido entre unos 500.000 libros pirateados, una cifra vinculada directamente al método de adquisición, y no a cómo se utilizaron posteriormente los libros en el entrenamiento (Copyright Alliance, «Participación en el acuerdo Bartz contra Anthropic», consultado el 17 de septiembre de 2026).

La sentencia subyacente del juez William Alsup en el caso Bartz contra Anthropic trazó una línea divisoria muy clara que el sector no esperaba del todo. El entrenamiento con los libros que Anthropic había adquirido y escaneado constituía un uso legítimo, «espectacularmente transformador», en sus propias palabras (Norton Rose Fulbright, Inside Tech Law, «Bartz contra Anthropic: se alcanza un acuerdo tras una sentencia sumaria histórica», consultado el 17 de septiembre de 2026). La descarga de copias piratas para crear una biblioteca de investigación permanente constituía un acto distinto y no se consideraba uso legítimo, independientemente del uso que se le diera posteriormente a los datos.

Esa distinción es más importante que la propia cifra del acuerdo. La adquisición y el uso son ahora dos cuestiones jurídicas distintas, y una empresa puede salir ganando en una de ellas y salir muy mal parada en la otra. Anthropic llegó a un acuerdo extrajudicial en agosto de 2025, y el juez Alsup concedió la aprobación preliminar al mes siguiente (CNBC, «El juez concede la aprobación preliminar a un acuerdo de 1.500 millones de dólares con los autores», 25 de septiembre de 2025, consultado el 17 de septiembre de 2026).

¿Acaso un laboratorio de IA con una sólida financiación corre realmente menos riesgos legales que un pequeño «scraper» que utilice la misma fuente pirateada? No necesariamente. El acuerdo demuestra que el tamaño no protege a nadie frente a una reclamación por el método de obtención, una vez que se ha establecido que esta es independiente de la cuestión del uso legítimo. Véase ¿Qué se considera datos de entrenamiento para la IA? en cuanto a los mecanismos subyacentes que estas resoluciones están evaluando.

The 2025 Pivot From Litigation to Licensing Horizontal timeline showing four 2025 AI copyright settlement events: Anthropic agrees to a 1.5 billion dollar settlement in Bartz v. Anthropic (August 2025); the court grants preliminary approval (September 2025); Universal Music Group settles with Udio and launches a licensed AI music platform (October 2025); Warner Music Group settles with both Udio and Suno (November 2025). The 2025 Pivot From Litigation to Licensing Major AI copyright settlements, Aug-Nov 2025 $1.5B settlement Bartz v. Anthropic Aug 2025 Court approval Preliminary approval granted Sep 2025 UMG x Udio deal Licensed AI music platform Oct 2025 WMG settles both Udio, then Suno Nov 2025 Source: Copyright Alliance; CNBC; Music Business Worldwide (2025)
El cambio de rumbo en 2025: de los litigios sobre derechos de autor relacionados con la inteligencia artificial a los acuerdos extrajudiciales y las licencias (Fuente: Copyright Alliance, CNBC, Music Business Worldwide, 2025)

¿Por qué Thomson Reuters se impuso a Ross Intelligence cuando Anthropic ganó el caso sobre el uso legítimo?

Thomson Reuters ganó el caso porque Ross Intelligence desarrolló un producto que competía directamente con el suyo a partir de contenidos con licencia que no estaba autorizada a utilizar con fines de entrenamiento. En febrero de 2025, el juez Stephanos Bibas (D. Del.) dictó sentencia sumaria parcial a favor de Thomson Reuters, lo que supuso la primera derrota en un juicio sumario para una empresa de IA que alegaba la defensa del uso legítimo en relación con los datos de entrenamiento (Goodwin Procter, «El tribunal rechaza la defensa basada en el uso legítimo en un caso de derechos de autor relacionado con la IA», consultado el 17 de septiembre de 2026).

Ross había utilizado los resúmenes jurisprudenciales de Westlaw —contenido editorial que Thomson Reuters había tardado décadas en recopilar— para entrenar una herramienta de investigación jurídica que competía directamente con la propia Westlaw. El juez Bibas consideró que dicho uso no era transformativo y resultaba perjudicial desde el punto de vista comercial para el mercado de la obra original (Jenner & Block, alerta a clientes, consultada el 17 de septiembre de 2026).

Compárese esto con el caso Kadrey contra Meta. En junio de 2025, el juez Vince Chhabria (Distrito Norte de California) concedió a Meta una sentencia sumaria parcial sobre el uso legítimo, a pesar de que algunos libros de formación procedían de bibliotecas paralelas, ya que los demandantes no pudieron demostrar que el uso realizado por Meta diluyera el mercado de sus obras (Goodwin Procter, consultado el 17 de septiembre de 2026). Se cuidó de señalar que un futuro demandante que pudiera demostrar la dilución del mercado podría ganar el caso, a diferencia de lo que ocurrió con estos demandantes (Copyright Alliance, «Kadrey contra Meta: sentencia», consultado el 17 de septiembre de 2026).

Entonces, ¿qué es lo que realmente distingue una defensa exitosa basada en el uso legítimo de una que resulta infructuosa? Resulta que es la competencia en el mercado, y no los aspectos técnicos de la copia en sí misma.

En su conjunto, estas sentencias sugieren que el método de adquisición y el uso competitivo constituyen dos vías independientes de responsabilidad. Anthropic perdió en lo relativo a la adquisición (piratería) a pesar de haber ganado en lo relativo al uso transformador. Ross perdió en lo relativo al uso competitivo a pesar de basarse en contenido de origen con licencia. Ninguno de estos factores garantiza por sí solo la protección.

Case What was trained on How the data was acquired Competes with the source? Fair use outcome
Bartz v. Anthropic Books, purchased and scanned Legally purchased copies (lawful) plus pirated copies from shadow libraries (unlawful) No Training on purchased books: fair use. Downloading pirated copies: not fair use, leading to the $1.5B settlement
Kadrey v. Meta Books, including from shadow libraries Partly pirated Plaintiffs did not prove market harm Fair use on this record; judge left the door open for plaintiffs who can show market dilution
Thomson Reuters v. Ross Intelligence Westlaw headnotes Licensed content, used without authorization for training Yes, a competing legal-research product Not fair use, the first summary judgment loss on AI training
Getty Images v. Stability AI (UK) Licensed stock images Used without a license; training occurred outside the UK Yes, a competing image-licensing business Copyright claim rejected on jurisdictional grounds; trademark infringement found instead

Los casos que aún se encuentran en trámite judicial

Varios de los casos más importantes sobre derechos de autor relacionados con la inteligencia artificial siguen sin resolverse, y sus resultados podrían redefinir aún más la doctrina del uso legítimo. Las demandas consolidadas del *New York Times* y del *Authors Guild* contra OpenAI se tramitan ahora en el procedimiento *In re OpenAI Copyright Litigation*, ante el juez Sidney Stein. A fecha de septiembre de 2026, el caso se encuentra en fase de instrucción, sin que se haya fijado aún una fecha para el juicio (Washington Post, «El Departamento de Justicia insta al juez a fallar a favor de OpenAI y Microsoft en la demanda del NY Times», 2 de septiembre de 2026, consultado el 17 de septiembre de 2026).

El juez Stein desestimó en gran medida la moción de desestimación presentada por OpenAI y Microsoft en abril de 2025, permitiendo que prosiguieran la mayoría de las demandas y rechazando explícitamente calificar el entrenamiento de la IA como «intrínsecamente transformador». Una resolución del 27 de octubre de 2025 fue aún más lejos: El juez Stein sostuvo que los resúmenes de la trama de las novelas de los demandantes generados por ChatGPT podrían constituir en sí mismos una infracción, una teoría de los «resultados» distinta de la cuestión del entrenamiento (IPWatchdog, «OpenAI pierde su intento de desestimar una demanda colectiva multidistrital por los resultados de ChatGPT», 28 de octubre de 2025, consultado el 17 de septiembre de 2026).

El caso también ha suscitado interés fuera del ámbito judicial. El 2 de septiembre de 2026, el Departamento de Justicia presentó un escrito en el que instaba al tribunal a fallar a favor de OpenAI y Microsoft (Washington Post, consultado el 17 de septiembre de 2026; Axios, «Demanda por derechos de autor entre el NYT, OpenAI y Microsoft», 8 de septiembre de 2026, consultado el 17 de septiembre de 2026).

El caso Getty Images contra Stability AI se dividió por un océano. El 4 de noviembre de 2025, el Tribunal Superior del Reino Unido dictaminó que la demanda por infracción de derechos de autor presentada por Getty no prosperaba, ya que el entrenamiento de Stability se había llevado a cabo fuera del Reino Unido; sin embargo, sí constató una infracción de marca registrada, dado que los primeros resultados de Stable Diffusion llevaban la marca de agua de Getty (Ropes & Gray, consultado el 17 de septiembre de 2026). El caso independiente de Getty en EE. UU., presentado de nuevo en el Distrito Norte de California, superó en abril de 2026 una moción de desestimación relativa a las reclamaciones por marca registrada y dilución, y el juicio está previsto para enero-febrero de 2028 (expediente de CourtListener, consultado el 17 de septiembre de 2026).

La misma teoría, según la cual los resultados generados por la inteligencia artificial que llevan la marca de agua de una marca o contienen contenido derivado reconocible constituyen una infracción, se está aplicando actualmente de forma simultánea en los tribunales del Reino Unido y de Estados Unidos. Las reclamaciones por derechos de autor se están restringiendo por motivos jurisdiccionales y de uso transformativo, pero las reclamaciones basadas en marcas registradas y en los resultados generados están cubriendo el vacío que dejan esas sentencias más restrictivas.

Esta tendencia va más allá del texto. Disney, Universal y Warner Bros. demandaron a Midjourney entre junio y septiembre de 2025 por la generación de imágenes, y los casos consolidados siguen en fase de litigio sobre la fase de presentación de pruebas a mediados de 2026 (Variety, consultado el 17 de septiembre de 2026; IPWatchdog, «La demanda de Warner Bros. alega que la infracción de los derechos de autor por parte de Midjourney es “sistemática” y “deliberada”», consultado el 17 de septiembre de 2026). En el ámbito musical, Universal Music Group llegó a un acuerdo con Udio en octubre de 2025, combinando una indemnización con un acuerdo de licencia para una nueva plataforma musical basada en IA, y Warner Music llegó a un acuerdo tanto con Udio como con Suno en noviembre de 2025 (Music Business Worldwide, consultado el 17 de septiembre de 2026). Sony sigue inmersa en un litigio con ambas plataformas. La presión tampoco se limita a los tribunales: véase por qué cada vez resulta más difícil acceder a los datos de la web en lo que respecta a la infraestructura, que se ve igualmente afectada por esta situación.

¿Se aplica algo de esto a la recopilación de datos públicos, y no solo al entrenamiento de la IA?

La extracción de datos de páginas web de acceso público no constituye, por sí misma, un delito federal, pero eso no significa que esté exenta de riesgos. El caso hiQ Labs contra LinkedIn zanjó esta cuestión en el Noveno Circuito: la extracción de datos de páginas públicas no infringe la disposición de la CFAA relativa a la «ausencia de autorización», aunque siguen siendo plenamente admisibles las reclamaciones por incumplimiento de contrato, derechos de autor e intrusión (White & Case, «Web scraping, website terms and the CFAA», consultado el 17 de septiembre de 2026).

Dicha sentencia se dictó tras la remisión del caso, después de que la resolución del Tribunal Supremo en el asunto Van Buren redujera el alcance de la CFAA. En el mismo procedimiento también se determinó que hiQ seguía infringiendo las Condiciones de servicio de LinkedIn, una reclamación contractual independiente que no se vio afectada por el fallo de la CFAA (Fenwick & West, «hiQ Labs Scrapes By Again», consultado el 17 de septiembre de 2026). En la práctica, la verdadera cuestión de riesgo pasó de ser «¿se trata de piratería informática?» a «¿tenía permiso o una licencia?».

Si extraer datos de páginas públicas no es piratería informática, ¿por qué se sigue bloqueando y demandando a las empresas por ello? Porque la inmunidad de la CFAA nunca ha abarcado las reclamaciones por incumplimiento de contrato, derechos de autor o allanamiento, y es precisamente ahí donde se centran ahora la mayoría de los litigios.

Un incidente independiente ocurrido en agosto de 2025 puso de manifiesto la rapidez con la que pueden actuar las medidas informales de cumplimiento. Cloudflare informó de que Perplexity utilizaba agentes de usuario y ASN no declarados y rotativos para seguir rastreando dominios de prueba que habían prohibido explícitamente el acceso a todos los rastreadores a través del archivo robots.txt (Search Engine Journal, «Cloudflare retira de su lista a Perplexity y le impide rastrear sitios web», consultado el 17 de septiembre de 2026). Cloudflare retiró a Perplexity su estatus de bot verificado y bloqueó su rastreador en toda la red, sin necesidad de presentar ninguna demanda judicial.

Perplexity rebatió públicamente la versión de los hechos ofrecida por Cloudflare (Search Engine Journal, consultado el 17 de septiembre de 2026). Independientemente de cómo se resuelva esa controversia, la lección sigue siendo válida: ser descubierto eludiendo un bloqueo declarado puede poner fin de la noche a la mañana al acceso de un rastreador a gran parte de la web. Para analizar con más detalle cuáles son los límites legales, consulte prácticas éticas de extracción de datos de la web.

Cómo están respondiendo los proveedores de infraestructuras

Los proveedores de infraestructura dejaron de esperar a las resoluciones judiciales y comenzaron a modificar ellos mismos los ajustes predeterminados. A partir del 1 de julio de 2025, Cloudflare estableció el bloqueo de los rastreadores de IA no autorizados como configuración predeterminada para todos los dominios nuevos, pasando del modelo anterior de «opt-in» (aceptación expresa) a uno de «opt-out» (exclusión voluntaria) (Cloudflare, comunicado de prensa, «Cloudflare acaba de cambiar la forma en que los rastreadores de IA recopilan datos de Internet en general», consultado el 17 de septiembre de 2026).

Cloudflare acompañó ese cambio con «Pay Per Crawl», un mecanismo que permite a los propietarios de sitios web cobrar a los rastreadores por el acceso; según la empresa, este se transformará en «Pay Per Use» a partir del 15 de septiembre de 2026, bloqueando de forma predeterminada los rastreadores de doble finalidad en las páginas financiadas con publicidad (Blog de Cloudflare, consultado el 17 de septiembre de 2026). En un periodo de tráfico comprendido entre el 19 y el 26 de junio de 2025, Cloudflare Radar detectó que Claude, de Anthropic, realizó aproximadamente 71 000 solicitudes de páginas HTML por cada referencia que devolvía a los sitios que rastreaba (Blog de Cloudflare/Radar, «Proporción entre rastreos y referencias de la IA en Radar», consultado el 17 de septiembre de 2026).

Most Sites Still Have No AI-Bot Signal Set Donut chart showing that of the top 10,000 web domains with a robots.txt file, only 14 percent have any AI-bot-specific directive; 86 percent have no AI-bot signal. Source: Cloudflare Radar, June 2025. Most Sites Still Have No AI-Bot Signal Set Share of top 10,000 domains with an AI-bot robots.txt directive 14% have an AI-bot robots.txt signal 14%: set an AI-bot-specific robots.txt directive 86%: no AI-bot signal set Source: Cloudflare Radar (June 2025)
Solo el 14 % de los 10 000 dominios más importantes ha establecido una directiva «robots.txt» específica para bots de IA (Fuente: Cloudflare Radar, junio de 2025)

La mayoría de los propietarios de sitios web aún no han establecido ninguna indicación. GPTBot fue el rastreador más bloqueado en ese mismo conjunto de datos, ya que fue rechazado por 312 de los 3.816 dominios que contaban con un archivo robots.txt, frente a solo 61 que lo permitían explícitamente (Blog/Radar de Cloudflare, consultado el 17 de septiembre de 2026).

Las autoridades reguladoras están empezando a considerar que las señales legibles por máquina son las únicas que cuentan. El 10 de diciembre de 2025, el Tribunal Regional Superior Hanseático de Hamburgo dictaminó en el caso Kneschke contra LAION (OLG Hamburgo, 5 U 104/24) que una opción de exclusión de la extracción de texto y datos solo es legalmente válida si es legible por máquina. Robots.txt, un encabezado X-Robots-Tag o el Protocolo de Reserva de TDM son válidos. Sin embargo, una cláusula oculta en los términos y condiciones de un sitio web redactados en lenguaje natural no lo es (Norton Rose Fulbright, Inside Tech Law, «Machine-Readable Opt-Outs and AI Training: Hamburg Court Clarifies Copyright Exceptions», consultado el 17 de septiembre de 2026).

Este enfoque se ajusta al Código de buenas prácticas de la UE sobre IA general (GPAI), publicado en julio de 2025 y suscrito por 23 desarrolladores de IA hasta julio de 2026, entre los que se incluyen OpenAI, Google, Anthropic y Microsoft, todos los cuales se comprometieron a realizar el rastreo con bots compatibles con el archivo robots.txt y a respetar las restricciones legibles por máquina.

Los proveedores de infraestructuras y los organismos reguladores están, de hecho, adelantándose a los tribunales en este ámbito. Cloudflare modificó su política predeterminada sobre rastreadores en julio de 2025, y el criterio de «señal legible por máquina» del tribunal de Hamburgo se estableció mucho antes de que la jurisprudencia estadounidense zanjara cuestiones comparables sobre el scraping y las licencias. Los equipos que esperen a que se resuelvan los litigios antes de ajustar su política podrían encontrarse con que los valores predeterminados ya han cambiado sin que se hayan dado cuenta.

Lo que deben hacer ahora los especialistas en extracción de datos y los equipos de datos

Los equipos de datos que consideran la procedencia como un aspecto secundario son los que se encuentran más expuestos a los riesgos que han generado estas sentencias. Solo el acuerdo de Bartz supuso un coste aproximado de 3.000 dólares por obra pirateada, repartidos entre unos 500.000 libros (Copyright Alliance, consultado el 17 de septiembre de 2026), una cifra que cualquier equipo jurídico puede multiplicar por el tamaño de su propio archivo sin licencia.

1. Realizar un seguimiento de la procedencia de los datos de principio a fin. Sepa exactamente de dónde procede cada dato utilizado para el entrenamiento o la recopilación, y si se obtuvo mediante licencia, se adquirió o se extrajo de fuentes abiertas. El caso de Anthropic demuestra que los organismos reguladores y los tribunales distinguirán entre el método de adquisición y el uso posterior a la hora de atribuir la responsabilidad.

2. Respete las señales de exclusión voluntaria legibles por máquina. Los archivos «robots.txt» y «ai.txt», así como el Protocolo de Reservas TDM, son los estándares que los organismos reguladores reconocen actualmente, incluso en aquellos casos en los que una jurisdicción aún no haya impuesto su aplicación.

3. Opte por las licencias en lugar de los atajos relacionados con la piratería. Las relaciones entre datos adquiridos o con licencia se sostienen ante los tribunales de una forma que no ocurre con los archivos pirateados, ya que la victoria de Anthropic en materia de uso legítimo respecto a los libros adquiridos no sirvió para eximirla de su responsabilidad por las copias pirateadas que se encontraban junto a ellos en la misma sesión de entrenamiento.

4. Evite las tácticas de evasión de identidad. El uso rotativo de agentes de usuario para eludir un bloqueo declarado conlleva la inclusión en una lista negra. No es necesario presentar ninguna demanda judicial. Antecedentes sobre En qué consiste realmente el «scraping» mediante IA constituye un punto de partida útil para realizar una auditoría de su propio proceso.

La procedencia es uno de los elementos que conforman una estrategia defendible de obtención de datos, pero no lo es todo. La red de proxies residenciales de Massive funciona en dispositivos de usuarios reales en más de 195 países; cada dispositivo se ha adherido voluntariamente a través del SDK de Massive, proporcionando código HTML o Markdown sin adulterar procedente de cualquier fuente pública en cualquier ubicación. Cuenta con la certificación SOC 2 y cumple con el RGPD, lo que constituye un elemento más de una estrategia de obtención de datos defendible, pero no un escudo legal ni un sustituto del asesoramiento jurídico.

Conclusión

Este año, el panorama jurídico en materia de datos de entrenamiento de la inteligencia artificial se ha dividido en dos vertientes distintas: cómo se obtienen los datos y cómo se utilizan; y los tribunales están ahora dispuestos a sancionar las infracciones en cualquiera de ellas de forma independiente.

  • El método de adquisición constituye ahora una vía de responsabilidad propia, independiente del uso legítimo.
  • El uso competitivo acaba con la defensa basada en el uso legítimo más rápidamente que la piratería: Ross Intelligence perdió rotundamente porque su herramienta competía directamente con Westlaw, una prueba a la que Anthropic y Meta nunca tuvieron que enfrentarse.
  • La infraestructura avanza más rápido que los tribunales. Cloudflare modificó la configuración predeterminada de su rastreador en julio de 2025; las autoridades reguladoras de la UE hicieron lo propio meses después.

Cabe esperar que se produzcan más acuerdos que combinen indemnizaciones y concesión de licencias, como los de UMG y Warner Music, hasta el año 2027, ya que el modelo de «demandar y luego conceder la licencia» sigue extendiéndose al ámbito del texto, la imagen y la música. En cuanto a los aspectos prácticos de la obtención de contenidos de forma defendible, consulte Creación de un canal de datos a partir de datos web en tiempo real.

Fuentes

  1. Copyright Alliance, «Participación en el acuerdo del caso Bartz contra Anthropic», consultado el 17 de septiembre de 2026
  2. CNBC, «Un juez da su visto bueno preliminar a un acuerdo de 1.500 millones de dólares con los autores», consultado el 17 de septiembre de 2026
  3. Norton Rose Fulbright / Inside Tech Law, «Bartz contra Anthropic: Se alcanza un acuerdo tras una sentencia sumaria histórica y la certificación de la demanda colectiva», consultado el 17 de septiembre de 2026
  4. Goodwin Procter, «Un tribunal rechaza la defensa basada en el uso legítimo en un caso sobre derechos de autor relacionado con la IA», consultado el 17 de septiembre de 2026
  5. Jenner & Block, nota informativa para clientes sobre el caso Thomson Reuters contra Ross Intelligence, consultada el 17 de septiembre de 2026
  6. Goodwin Procter, «Fallo de un juez del Distrito Norte de California» (Kadrey contra Meta), consultado el 17 de septiembre de 2026
  7. Copyright Alliance, «Sentencia en el caso Kadrey contra Meta», consultado el 17 de septiembre de 2026
  8. Washington Post, «El Departamento de Justicia insta al juez a fallar a favor de OpenAI y Microsoft en la demanda contra el New York Times», consultado el 17 de septiembre de 2026
  9. Axios, «Demanda por derechos de autor entre el NYT, OpenAI y Microsoft», consultado el 17 de septiembre de 2026
  10. IPWatchdog, «OpenAI no consigue que se desestime la demanda colectiva multidistrital por los resultados de ChatGPT», consultado el 17 de septiembre de 2026
  11. Ropes & Gray, «Getty Images pierde la demanda por infracción de derechos de autor contra Stability AI en el primer caso del Reino Unido...», consultado el 17 de septiembre de 2026
  12. Cleary Gottlieb, «El Tribunal Superior del Reino Unido dicta una sentencia histórica en el caso Getty Images contra Stability AI», consultado el 17 de septiembre de 2026
  13. CourtListener, expediente del caso Getty Images (US) Inc. contra Stability AI Ltd., consultado el 17 de septiembre de 2026
  14. Music Business Worldwide, «Universal Music resuelve la demanda de Udio y llega a un acuerdo para una plataforma de música generada por IA con licencia», consultado el 17 de septiembre de 2026
  15. Hollywood Reporter, «Universal Music Group anuncia un acuerdo con Udio», consultado el 17 de septiembre de 2026
  16. Variety, sobre el litigio relativo a la revelación de pruebas de Midjourney Studios, consultado el 17 de septiembre de 2026
  17. IPWatchdog, «La demanda de Warner Bros. alega que la infracción de los derechos de autor por parte de Midjourney es “sistemática” y “deliberada”», consultado el 17 de septiembre de 2026
  18. White & Case, «Web scraping, condiciones de uso de los sitios web y la CFAA: se confirma de nuevo la medida cautelar a favor de hiQ», consultado el 17 de septiembre de 2026
  19. Fenwick & West, «hiQ Labs vuelve a salir airosa: el Noveno Circuito reafirma que la extracción de datos no infringe la CFAA», consultado el 17 de septiembre de 2026
  20. Blog de Cloudflare/Radar, «Proporción entre rastreo y visitas procedentes de referencias en Radar», consultado el 17 de septiembre de 2026
  21. Cloudflare, comunicado de prensa, «Cloudflare acaba de cambiar la forma en que los rastreadores de IA recopilan información de Internet en general», consultado el 17 de septiembre de 2026
  22. Search Engine Journal, «Cloudflare elimina a Perplexity de su lista y le impide rastrear sitios web», consultado el 17 de septiembre de 2026
  23. Norton Rose Fulbright, Inside Tech Law, «Exclusiones legibles por máquina y entrenamiento de la IA: un tribunal de Hamburgo aclara las excepciones en materia de derechos de autor», consultado el 17 de septiembre de 2026

Preguntas frecuentes

¿Es ilegal extraer datos de sitios web de acceso público?+

No de forma intrínseca. El Noveno Circuito dictaminó en el caso hiQ Labs contra LinkedIn que la extracción de datos de páginas de acceso público no infringe la CFAA (White & Case, consultado el 17 de septiembre de 2026). No obstante, siguen siendo plenamente aplicables las reclamaciones por incumplimiento de contrato, derechos de autor e intrusión en la propiedad privada, por lo que quien realice el «scraping» puede seguir enfrentándose a una responsabilidad real sin infringir dicha ley en concreto. Véase Cómo proporcionar a los agentes de IA acceso en tiempo real a la web en lo que respecta al archivo robots.txt y al acceso de los rastreadores.

¿Se considera uso legítimo el entrenamiento de un modelo de inteligencia artificial con material protegido por derechos de autor?+

Depende de la adquisición y la competencia, no solo de la transformación. El juez Alsup dictaminó que el entrenamiento basado en libros adquiridos constituía un uso legítimo en el caso Anthropic, mientras que el juez Bibas dictaminó que el entrenamiento de Ross Intelligence basado en los resúmenes de Westlaw para un producto de la competencia no lo era, lo que supuso la primera derrota de este tipo (Goodwin Procter, consultado el 17 de septiembre de 2026).

¿Cuál es la diferencia entre las sentencias sobre derechos de autor en materia de inteligencia artificial de Anthropic y de Thomson Reuters?+

Anthropic salió victoriosa en lo relativo a la formación transformativa, pero perdió en el ámbito de la piratería, lo que dio lugar a un acuerdo extrajudicial por valor de 1.500 millones de dólares por unos 500.000 libros pirateados (Copyright Alliance, consultado el 17 de septiembre de 2026). Ross Intelligence perdió rotundamente porque utilizó contenido con licencia de Westlaw para crear un producto que competía directamente con este, un resultado relacionado con la competencia en el mercado más que con el método de formación en sí mismo.

¿Cómo pueden los equipos de datos reducir el riesgo jurídico a la hora de recopilar datos de entrenamiento?+

Realice un seguimiento de la procedencia de cada dato de entrada, respete las señales de exclusión legibles por máquina, como «robots.txt» y el Protocolo de Reserva TDM, y dé prioridad a los datos con licencia o adquiridos frente a los atajos relacionados con la piratería. Cloudflare constató que, en junio de 2025, solo alrededor del 14 % de los dominios más importantes había configurado alguna señal de robots.txt para bots de IA (Cloudflare Radar, consultado el 17 de septiembre de 2026), lo que deja la mayor parte de la exposición sin abordar de forma predeterminada.