RestricciónAutomatización cognitiva2025-02-17
Un estudio en Nature Machine Intelligence con 3.200 participantes halló que los modelos de lenguaje usados en lugar de participantes humanos, también en pruebas con usuarios, representan de forma errónea y homogeneizan a los grupos de identidad
Diseñador de producto / UXpágina de la ocupación →Fecha del hecho / publicación
2025-02-17
Categoría de la evidencia
RestricciónUn fallo, una marcha atrás, una regulación o un coste están frenando la adopción. Puede bajar una evaluación o ensanchar su incertidumbre.
Tareas sobre las que incide
Investigación y pruebas de usabilidad
Ver a usuarios atascarse, hacer entrevistas, leer la analítica y convertir lo que viste en una decisión.
Aumentada por la máquina✓ Con evidencia
Dónde aplica esto
Un estudio revisado por pares sobre modelos de lenguaje usados como sustitutos de participantes humanos en ciencias sociales computacionales, pruebas con usuarios y anotación. A partir de estudios con 3.200 participantes humanos de 16 identidades demográficas y de cuatro modelos, los autores muestran que los modelos representan de forma errónea y homogeneizan a los grupos demográficos, y que sus propias técnicas aplicadas en el momento de la inferencia reducen esos daños pero no los eliminan. No es específico del trabajo de UX y prueba los modelos vigentes en su momento; los autores declaran no tener conflictos de intereses.
Qué significa esto
Sustituir a las personas de la investigación con usuarios por usuarios simulados tiene un coste medido: la simulación representa mal precisamente a los grupos que más necesita escuchar quien diseña. Observar a usuarios reales sigue siendo la parte de la investigación en la que un modelo no puede ocupar su lugar.
Qué no muestra todavía
Un estudio de los modelos de su momento, no específico de las pruebas de usabilidad; no muestra cómo investigan hoy los equipos de diseño.
Qué puedes comprobar
Abre el artículo de Nature Machine Intelligence del 17 de febrero de 2025 y busca «as replacements for human participants in computational social science, user testing, annotation tasks».
¿Cambia la evaluación?
No. El índice de impacto no lo mueve nunca un solo hecho. Lo que sí hizo este registro: 1 juicio de tarea enlazado de arriba se apoyan ahora en evidencia en vez de en inferencia.
Fuente
Wang, Morgenstern & Dickerson — "Large language models that replace human participants can harmfully misportray and flatten identity groups", Nature Machine Intelligence 7 (published 17 February 2025) · verificado 2026-09-28 · Claude (VOLO agent) · interpretado 2026-09-28 · Claude (VOLO agent)
Fuente primaria: publicada por la parte que hizo esto, o por la autoridad de referencia. No necesita cofirma.