Prueba pilotoAutomatización cognitiva2026-03-16
Los equipos de diseño del Gobierno del Reino Unido probaron GOV.UK Chat en pilotos con más de 10.000 usuarios y 99 pruebas de usabilidad remotas, añadieron preguntas aclaratorias y vieron que las respuestas en streaming obligaban a rediseñar salvaguardas de seguridad
Diseñador de producto / UXpágina de la ocupación →Fecha del hecho / publicación
2026-03-16
Categoría de la evidencia
Prueba pilotoEnsayo a pequeña escala en un entorno real. Nos dice que se están probando las condiciones de despliegue, no que se cumplan, así que un piloto nunca basta por sí solo; dos independientes sí.
Tareas sobre las que incide
Investigación y pruebas de usabilidad
Ver a usuarios atascarse, hacer entrevistas, leer la analítica y convertir lo que viste en una decisión.
Aumentada por la máquina✓ Con evidencia
Diseñar para productos no deterministas
Dar forma a productos cuya salida varía — interfaces conversacionales, agentes, contenido generado — donde el viejo oficio de pantalla a pantalla no sirve.
Tarea nueva✓ Con evidencia
Dónde aplica esto
El servicio digital del Gobierno del Reino Unido describiendo su propio producto. A lo largo de 18 meses hizo dos pilotos públicos de GOV.UK Chat en los que más de 10.000 usuarios hicieron 26.000 preguntas; introdujo preguntas aclaratorias cuando las preguntas de los usuarios eran ambiguas, lo que subió hasta el 88% la tasa de respuesta a las preguntas dentro de su ámbito; las respuestas en streaming salieron bien en las pruebas con usuarios, pero exigen rediseñar algunas salvaguardas de seguridad; y la investigación usó métodos como 99 pruebas de usabilidad remotas y un estudio de diario con 30 horas de entrevistas en vídeo. Es un piloto contado por el equipo que lo construyó; el asistente funciona con un modelo de Anthropic, la empresa que desarrolla el modelo que redactó esta ficha.
Qué significa esto
Diseñar un asistente generativo resultó exigir recursos de diseño nuevos — hacer al usuario una pregunta aclaratoria, replantear la seguridad de unas respuestas que aparecen mientras se escriben — y mucha investigación con usuarios reales. El trabajo de diseño creció en vez de encogerse.
Qué no muestra todavía
Un piloto de un solo gobierno contado por su propio equipo; no muestra cómo diseñan o prueban las funciones de IA los equipos de las empresas privadas.
Qué puedes comprobar
Abre la entrada de Inside GOV.UK del 16 de marzo de 2026 y busca «we conducted 99 remote usability tests».
¿Cambia la evaluación?
No. El índice de impacto no lo mueve nunca un solo hecho. Este registro tampoco cambió de capa a nada: los 2 juicios enlazados de arriba ya se apoyaban en evidencia anterior. Este se suma a ella.
Fuente
Government Digital Service — Inside GOV.UK blog, "5 things we learned testing GOV.UK Chat, an AI assistant for government" (Lead Product Manager, GOV.UK AI, and Lead User Researcher, GDS; posted 16 March 2026) · verificado 2026-09-28 · Claude (VOLO agent) · interpretado 2026-09-28 · Claude (VOLO agent)
Fuente primaria: publicada por la parte que hizo esto, o por la autoridad de referencia. No necesita cofirma.