TheVortiq
Inteligencia Artificial

Google y Reddit pierden batalla legal por web scraping

Un tribunal falla que el scraping de resultados de búsqueda no infringe derechos de autor, asestando un golpe a los intentos de controlar la IA.

28 de julio de 2026 · 5 min de lectura

a 3d image of a judge's hammer on a black background
Foto de Conny Schneider en Unsplash

¿Qué ha ocurrido?

Un tribunal federal de Estados Unidos desestimó la demanda interpuesta por Google contra SerpApi, una empresa de scraping que extrae resultados de búsqueda de Google y los vende como servicio. Google había presentado la demanda en diciembre de 2025, invocando la Ley de Derechos de Autor del Milenio Digital (DMCA) y argumentando que SerpApi eludía sus medidas antiscraping para acceder a contenido protegido por derechos de autor, como los paneles de conocimiento (knowledge panels). Sin embargo, el tribunal falló que los resultados de búsqueda de Google son esencialmente hechos o datos no protegibles por copyright, y que el scraping de dichos resultados no constituye una infracción. El caso, que también involucraba a Reddit como co-demandante, fue desestimado con perjuicio, aunque Google ya ha anunciado que apelará la decisión.

Este fallo se produce en un contexto de creciente tensión entre las grandes plataformas tecnológicas y los desarrolladores de inteligencia artificial, que dependen del scraping de datos públicos para entrenar sus modelos. Google había intentado utilizar la DMCA como una herramienta para bloquear a scrapers como SerpApi, pero el tribunal consideró que los fragmentos de texto mostrados en los resultados de búsqueda —como títulos, descripciones y extractos— no son obras creativas originales, sino meras compilaciones de datos factuales. Según Ars Technica, Google alegaba que sus medidas antiscraping protegían contenido licenciado de terceros, como los paneles de conocimiento, pero el juez determinó que incluso esos paneles no alcanzan el umbral de originalidad necesario para la protección por derechos de autor.

¿Por qué es importante?

La decisión tiene implicaciones de gran alcance para el ecosistema digital, especialmente en el ámbito de la inteligencia artificial y la recolección de datos. Al establecer que los resultados de búsqueda no son obras protegidas por copyright, el tribunal ha creado un precedente que podría debilitar los esfuerzos de Google, Reddit y otras plataformas para restringir el scraping mediante reclamaciones de propiedad intelectual. Históricamente, las plataformas han utilizado la DMCA para eliminar contenido infractor, pero este caso marca un límite claro: la ley no protege la mera agregación de hechos, incluso si están organizados en un formato estructurado como una página de resultados.

Para los desarrolladores de IA, el fallo reduce el riesgo legal de recolectar datos a gran escala de sitios públicos. Empresas como OpenAI, Anthropic y startups más pequeñas ahora tienen un argumento judicial sólido para defender sus prácticas de scraping. Sin embargo, la batalla legal está lejos de terminar. Google ha confirmado que apelará, y podría recurrir a otras leyes, como la Computer Fraud and Abuse Act (CFAA), que prohíbe el acceso no autorizado a sistemas informáticos. En paralelo, plataformas como Reddit han endurecido sus términos de servicio y han comenzado a cobrar por el acceso a su API, una estrategia que ya ha generado controversia entre desarrolladores de aplicaciones de terceros.

Consecuencias para el ecosistema digital

El impacto del fallo se puede desglosar en varios niveles:

  • Para la IA y el scraping: La decisión allana el camino para una recolección más agresiva de datos públicos, lo que podría acelerar el entrenamiento de modelos de lenguaje y otras aplicaciones de IA. Sin embargo, también podría generar una reacción en contra por parte de las plataformas, que podrían implementar barreras técnicas más sofisticadas o presionar para cambiar la legislación. El caso recuerda a la batalla legal entre LinkedIn y hiQ Labs en 2019, donde un tribunal de apelaciones dictaminó que el scraping de datos públicos era legal, sentando un precedente que ahora se refuerza con esta nueva decisión.
  • Para las plataformas: Google y Reddit pierden una herramienta legal clave para bloquear scrapers. A corto plazo, podrían intensificar el uso de CAPTCHAs, bloqueo de IPs y otras medidas técnicas, así como modificar sus términos de servicio para prohibir explícitamente el scraping. No obstante, la vía de derechos de autor queda cerrada, lo que obliga a las plataformas a buscar alternativas legales o técnicas. Reddit, en particular, ha estado en el centro de la polémica tras cobrar por el acceso a su API, lo que provocó protestas masivas de moderadores en 2023. Este fallo podría debilitar su posición en futuras negociaciones con scrapers.
  • Para los derechos de autor: El tribunal reafirmó la doctrina de que los hechos y datos no son protegibles por copyright, incluso si están compilados en una base de datos o presentados de manera estructurada. Esto limita el alcance de la DMCA en el contexto del scraping y podría influir en casos futuros sobre propiedad intelectual en la era de la IA. Por ejemplo, el caso en curso contra Stability AI por el uso de imágenes con derechos de autor para entrenar modelos podría verse afectado, aunque en ese caso las imágenes sí son obras creativas protegidas.

El abogado de SerpApi declaró: "Google y Reddit no son dueños de Internet", resumiendo el espíritu de la decisión. Sin embargo, la comunidad tecnológica observa con atención los próximos pasos. Google ya ha anunciado que apelará, y es probable que el caso llegue a tribunales superiores, donde el precedente podría ser revertido o matizado. Además, el Congreso de Estados Unidos podría considerar legislación específica sobre scraping y datos para IA, lo que añadiría otra capa de incertidumbre.

¿Qué deben saber los lectores?

Este caso no es el fin de la batalla, sino un hito en un conflicto más amplio entre el control de datos y la innovación. Para las startups y desarrolladores de IA, la decisión reduce el riesgo legal inmediato, pero no elimina la posibilidad de demandas basadas en otras leyes, como la CFAA o violaciones de términos de servicio. Las empresas que dependen del scraping deben asegurarse de cumplir con las leyes de acceso no autorizado y respetar las medidas técnicas razonables, aunque el tribunal no consideró que la elusión de medidas antiscraping fuera ilegal en este caso.

Para los usuarios comunes, el fallo podría tener efectos mixtos. Por un lado, un acceso más abierto a los datos públicos podría fomentar la competencia y la innovación en IA, beneficiando a los consumidores con mejores productos. Por otro lado, las plataformas podrían volverse más restrictivas en el acceso a sus servicios, limitando la personalización o aumentando los costos para los desarrolladores de terceros. El equilibrio entre propiedad de datos e innovación se redefine constantemente en los tribunales, y este caso es un recordatorio de que la ley aún se está adaptando a la era digital.

"Este fallo no es una carta blanca para el scraping indiscriminado, pero sí un reconocimiento de que los datos públicos no son propiedad privada de las plataformas", comentó un analista legal citado por Ars Technica.

La comunidad tecnológica seguirá de cerca la apelación de Google, mientras el debate sobre quién controla los datos en internet se intensifica. La decisión también podría influir en la Unión Europea, donde la Directiva de Derechos de Autor en el Mercado Único Digital ya ha generado controversia sobre el uso de datos para IA. En resumen, el caso SerpApi marca un punto de inflexión en la lucha por los datos, pero el resultado final aún está por escribirse.

Puntos clave

  • Google y Reddit pierden demanda contra SerpApi por scraping de resultados de búsqueda.
  • El tribunal dictamina que los fragmentos de búsqueda no son obras protegidas por derechos de autor.
  • La decisión sienta un precedente que facilita la recolección de datos para entrenar modelos de IA.
  • Google apelará y buscará otras vías legales para restringir el scraping.
  • El caso redefine los límites de la propiedad intelectual en internet.

Preguntas frecuentes

¿Qué es SerpApi?

SerpApi es una empresa que ofrece un servicio de API para extraer resultados de búsqueda de Google y otros motores, utilizado por desarrolladores y empresas para acceder a datos de búsqueda estructurados.

¿Por qué Google demandó a SerpApi?

Google acusó a SerpApi de eludir sus medidas antiscraping y vender contenido de sus resultados de búsqueda, argumentando que violaba la DMCA al proteger contenido con derechos de autor en los paneles de conocimiento.

¿Qué significa este fallo para la IA?

El fallo fortalece la posición legal de quienes recolectan datos públicos para entrenar modelos de IA, al establecer que los resultados de búsqueda no están protegidos por derechos de autor, reduciendo el riesgo de litigios.

Fuentes utilizadas

Comentarios

Sé el primero en comentar.

Deja tu comentario