PunchPHOTOS: Osimhen resumes training ahead of Kasimpasa clashBollywood HungamaKiara Advani and Sidharth Malhotra announce second pregnancy with adorable post: “Blessed once again”The Jerusalem PostExtremist Israeli settlers attack Palestinian home in West Bank, set vehicle on fire - reportESPN DeportesEspaña estira el mayor invicto de la historia: cuántos partidos lleva sin perderDaily MaverickDRAFT DODGING: Three years, 6,000 pages, no labels: Who’s stalling SA’s food warnings?ESPNMessi marks tearful Argentina farewell with goal: Wish I could play foreverInquirerProsecution seeks to show Dutertes hid P96M via unused manager’s checksThe South AfricanLionel Messi retires from international football in styleSky TG24Lewis Capaldi compie 30 anni, le sue canzoni più famose da Someone you Loved a Forget MeBusiness AMAI-aandelen stuwen S&P 500 en Nasdaq naar nieuwe recordhoogtesZDF heuteAktuelle Pressemitteilungen des ZDFRTP DesportoPortugal perde com Itália no Mundial feminino de hóquei
The Daily Newsstand · Free, Always
Wednesday, October 7, 2026

Alguien ha entrenado un modelo IA para detectar textos escritos con IA y dice detectarlos con un 98% de precisión

Translate

Que estamos rodeados por texto escrito por una IA ya no sorprende a nadie. Los que queremos leer a personas vamos todo el día con el hacha levantada buscando indicios para comprobar si estamos leyendo a un humano o a un robot, pero aunque eso pueda ser una cuestión ética o de preferencia, hay ámbitos como el educativo en el que hacen falta herramientas buenas que detecten el texto escrito por IA.

Y digo "buenas" porque algunas de las que más fama tienen fallan más que una escopeta de feria calificando como "hecho por IA" textos humanos y viceversa. Un investigador llamado Jochen Madler se ha cansado y ha ideado un sistema que no sólo dice si un texto es IA o no, sino si ese texto está escrito por un humano que simplemente se ha dedicado a parafrasear el resultado que le ha dado la IA. 

¿Resultado? Un macro F1 cercano al 98%.

En corto. El estudio se titula 'SlopShape' y, en él, Madler expone que el sistema analizó una serie de textos cuyo modelo nunca había visto y alcanzó el mencionado 98% de éxito a la hora de etiquetar si había sido escrito por una IA o por un humano de principio a fin. 

Según el investigador, el sistema no lee el texto y emite el veredicto, sino que un modelo de lenguaje responde para cada post un cuestionario de más de 200 preguntas sobre cómo está montado ese texto. En concreto, analiza el orden en el que se presentan las ideas, si el artículo anuncia su estructura por adelantado, se fija en dónde aparece la tesis, cómo se presentan las fuentes, la orientación práctica del artículo o si el texto termina repitiendo o reformulando la conclusión.

Noruega le está mostrando al mundo una opción ante la IA dentro de las escuelas: no integrarla en absoluto

El experimento. Para ponerlo a prueba, reunió 2.250 posts de blogs de 268 empresas de comunicación, todos ellos publicados antes de que se lanzara ChatGPT y recuperados usando Wayback Machine. Luego, pidió a cinco modelos (GPT-5.4, Claude Sonnet 4.6, Gemini 3 Flash, DeepSeek V3.2 y Kimi K2.5 que escribieran su propia versión a partir de un resumen del contenido original.

En total fueron 11.250 versiones generadas por esos modelos, escritas y reescritas de nuevo, para comprobar hasta qué punto su sistema podía identificar cambios desde profundos a menores. El resultado fue que, en las pruebas, obtuvo alrededor de 97-98 de macro F1, una métrica que combina precisión y cobertura para humanos e IA.

Cuando se reescribían los textos varias veces usando la IA, ese macro F1 apenas variaba. Sólo bajó significativamente cuando se cambiaban características de estilo (con una puntuación de 88,1). La conclusión es que la IA deja una huella en la arquitectura del discurso, dando textos previsibles, muy masticados y con conclusiones repetitivas. De hecho, según las pruebas, en un 79% de las ocasiones el sistema podía incluso señalar qué modelo había escrito qué en función de los 'dejes' de cada uno de ellos.

Jochen Madler Imagen | Jochen Madler

La forma del slop. Y el meollo: lo que da pistas a la herramienta es lo que da título a la investigación, esa "forma del slop". Según Madler, suelen tener estos rasgos:

  • Forma muy ordenada, a veces con bullet points iniciales que indican los apartados.
  • El título promete exactamente lo que el artículo va a dar, sin aportar contexto tangencial.
  • La introducción enseguida presenta la tesis y luego sigue una estructura de "definición, ventajas, pasos, errores y recomendaciones" como si fuera una guía o experto.
  • La conclusión termina parafraseando la idea que ya anunciaba en la introducción.

Hay otros factores, como afirmaciones sin fuentes, estadísticas sin contexto o una especie de listas de pros y contras que siempre están equilibradas y que no aportan nada.

China ha resuelto el dilema de la IA en la educación: asignatura troncal y profesores con formación especializada

PERO. Que que se cumplan estos rasgos no demuestra que un texto lo haya escrito una IA. De hecho, en prensa y antes de ChatGPT, nos encontramos con agencias de comunicación que lanzaban mensajes siguiendo esa estructura tan corporativa. Tiene sentido porque son los textos que han usado para el estudio y también con los que la IA de las diferentes compañías han sido entrenadas (entre tantas y tantas cosas robadas para dicho entrenamiento, claro). 

Además, y esto es importante, el estudio se ha hecho con artículos en inglés, por lo que no se puede aplicar a otros idiomas ni a cualquier texto escrito en Internet. La conclusión es que lo característico de las formaciones es la combinación repetida de todos y cada uno de esos factores que pueden hacernos sospechar y, sobre todo, los textos con "mucho texto" y que no sólo no aportan nada, sino que no muestran una progresión de ideas.

Pero bueno, al final, de momento es una investigación más sobre algo que, evidentemente, es un problema. Y es que, en una era en la que cada dos por tres se lanzan más y más modelos de frontera, son necesarias herramientas para distinguir quién ha hecho qué texto. Como curiosidad, he analizado este texto y soy un 70% humano. Y en este otro dice que un 80% cuando es una entrevista. Hay que seguir afinando la herramienta.

post de IA Que un artículo de entrevista contado de forma más narrativa tenga esta puntuación no habla muy bien de la herramienta

Imágenes | Jochen Madler

En Xataka | El último informe PISA sugiere un desplome por culpa de la IA y las pantallas. Quizá solo sea un error de medición

View the original on Xataka →

KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.