Opeeni’s Free-For-Trinse-to-Der-Fort-Foe-Foes, Google y Meta han terminado

Photo-ilustración: inteligente; Foto: Getty Images

Puede dividir la historia reciente de los datos de LLM que rocían algunas fases. Durante años hubo un período experimental, cuando las consideraciones éticas y legales sobre dónde y cómo adquirir datos de capacitación para modelos experimentales hambrientos se procesaron como dudas. Una vez que aplicaciones como ChatGPT se han vuelto populares y las empresas han comenzado a comercializar modelos, la cuestión de los datos de capacitación se ha vuelto de inmediato y extremadamente controvertido.

Los autores, cineastas, músicos y editores importantes y compañías de Internet han comenzado a llamar a compañías de inteligencia artificial y a la intención de acciones legales. Openi comenzó a hacer negocios individuales con editores y plataformas, incluido Reddit E Nueva York‘S Compañía propietaria, medios para garantizar el acceso continuo a los datos para capacitación y contenido de chat actualizado, mientras que otras compañías, incluidas Google y Amazon, han ingresado en sus licencias. A pesar de estos acuerdos legales y batallas, sin embargo, el raspado solo se ha convertido Además Manejo y descarado, dejando el resto de la web para preguntarse qué debería suceder exactamente más tarde.

Están en contra de actores sofisticados. Las nuevas empresas y las megafías tecnológicas financiadas de una manera generosa buscan datos de alta calidad donde puedan encontrarlos, Offline y On y Web Rasting se han convertido en una carrera de armamento. Hay raspadores enmascarados por motores de búsqueda o usuarios regulares y las compañías bloqueadas están construyendo un rastreador encubierto. Los operadores del sitio web, acostumbrados a tener al menos control nominal sobre el hecho de que los motores de búsqueda indican su contenido, están viendo lo mismo en sus datos: enjambres de máquinas voraces que hacen intentos constantes de recopilar su contenido, enviándolos con miles de millones de solicitudes. Los proveedores de infraestructura de Internet dicen lo mismo: los rastreadores de inteligencia artificial se están rompiendo. Una lista atrapada de sitios presumiblemente raspados de Meta, obtenidos de las noticias del sitio de caída, incluye «contenido protegido por derechos de autor, contenido pirateado y videos de adultos, algunos de los cuales se obtienen o se registran ilegalmente, así como noticias y contenido originales de tiendas destacadas y editores de contenido». Esto no es sorprendente ni único para una sociedad. Está más cerca de la práctica estándar en el sector.

Durante décadas, la razón más obvia para rastrear la web fue crear un índice útil o, más tarde, un motor de búsqueda como Google. Un rastreo de Google significaba que tenía la oportunidad de presentarse en los resultados de búsqueda y que las personas reales podían visitar su sitio web. AI Crawler ofrece una propuesta diferente. Vienen, se arrastran y copian. Luego usan los datos copiados para crear productos que, en muchos casos, compitan con sus fuentes (ver: Wikipedia o cualquier sitio de noticias) y en la mayoría de las ofertas a cambio de enlaces al pie de la página seguirán a algunas personas (ver: búsqueda de chatgpt y modas de IA de Google). Para un ecosistema de publicación en línea que ya falla al borde del colapso, este acuerdo parece profundamente sombrío. Las compañías de inteligencia artificial han raspado la web para crear modelos que continuarán raspando la web hasta que no quede nada.

En junio, Cloudflare, una compañía de infraestructura de Internet que administra una parte significativa del tráfico en línea, anunció una serie de herramientas para monitorear la acumulación de EI para construir un «mercado» que permitiría a los sitios arreglar los precios para «acceder y acceder a su contenido para ingerir en estos sistemas». Esta semana, un grupo de organizaciones y sitios web en línea, tracto que Reddit, Medium, Quora y Cloudflare compitieron rápidamente, anunciaron rápidamente el estándar RSL, abreviado por las licencias realmente simplemente (una referencia a RSS o al alcalde realmente simple, algunos cocreadores de los cuales están involucrados en el esfuerzo). La idea es simple: con los motores de búsqueda, los editores podrían indicar si querían ser indexados y los principales motores de búsqueda generalmente están obligados; Ahora, en circunstancias más antagónicas, cualquier persona que contenga podrá indicar no solo si el contenido puede ser raspado, sino cómo debe atribuirse y, sobre todo, cuánto desean cargar para su uso, individualmente o como parte de un grupo coordinado.

En cuanto al pago de las principales compañías de inteligencia artificial, sin mencionar que los cientos de pequeñas empresas que también están raspando, RSL es claramente un esfuerzo aspirador y dudo que el primer paso aquí sea por objetivo o abierto a cavar instantáneamente y comenzar a pagar regalías a WebMD. Combinado con la posibilidad de utilizar servicios como CloudFlare y rápidamente más efectivo bloquear Sin embargo, las compañías de inteligencia artificial marcan el comienzo de un cambio potencialmente importante. Para la mayoría de los sitios web, hasta ahora la división de la IA ha sido una red negativa y no hay mucho que perder al cerrarla (con la excepción de Google, que se desprende de su investigación y productos utilizando las mismas herramientas). Ahora, con el apoyo de las compañías de infraestructura de Internet que en realidad pueden mantenerse al día con las tácticas de raspado de Big Tech, pueden. (Los gigantes tecnológicos no han estado por encima de que raspe el contenido mutuamente, pero están mucho mejor equipados para detenerlo si lo quieren).

Un mundo en el que la mayoría de los sitios web públicos se vuelven invisibles para las empresas de inteligencia artificial de forma predeterminada es un mundo en el que las empresas que han dependido de un acceso relativamente sin paradas a la Web podrían comenzar a dañar la información actualizada, ya sean las últimas noticias, nuevas investigaciones, nuevos productos o solo cultura y memes ambientales. Es posible que no estén inclinados a pagar a todos, pero al final podrían verse obligados a pagarle a alguien, a través de RSL o algo más.

Andy Yaipen

Acerca de Andy Yaipen

Andy Yaipen es un matemático emprendedor, ingeniero industrial que intenta ayudar en temas académicos y profesionales en empresas tecnológicas en latinoamerica y en el mundo.

Ver todas las entradas de Andy Yaipen →