Lección 161 de 170

Evaluar la variación sin venerar la cantidad

Curso de desarrollo de videojuegos con IA

Usa muestreo, rechazo y controles de calidad para juzgar si el contenido generado es jugable, tiene propósito y merece conservarse.

2326. Identidad de la lección

Módulo
5.12 — Contenido procedural
Lección
Evaluar la variación sin idolatrar la cantidad
Tipo académico
Laboratorio de depuración
Tipo de esquema
práctica
Orden
2 dentro de la secuencia del módulo
Tiempo estimado
40–50 minutos, incluida la práctica

Esta lección convierte la generación procedural en un problema de evaluación. Inspeccionarás un conjunto de muestras, separarás la variación útil del ruido y revisarás las restricciones del generador usando evidencia en lugar de contar resultados.

2327. Objetivo de aprendizaje

Al finalizar esta lección, podrás evaluar un conjunto de muestras generadas según criterios de jugabilidad y propósito, identificar patrones de fallo y revisar las restricciones o los filtros de rechazo del generador en consecuencia.

2328. Por qué importa

Un generador puede producir cientos de resultados y, aun así, muy pocos ser utilizables. La cantidad no compensa una navegación rota, decisiones repetitivas, variaciones irrelevantes o diseños que contradicen la experiencia buscada. En un flujo asistido por IA, evaluar muestras es más importante que pedir más generación. El objetivo es construir un generador que produzca candidatos dignos de revisión, no una carpeta llena de resultados sin examinar.

2329. Conocimientos previos

Ya deberías poder:

  • Definir invariantes procedurales y distinguirlas de las preferencias.
  • Describir las entradas, restricciones y condiciones de aceptación del generador de Diseñar un generador a partir de invariantes.
  • Inspeccionar un resultado generado y registrar si cumple una propiedad obligatoria.

2330. Concepto central

La variación procedural necesita dos controles distintos:

  1. El muestreo crea un conjunto exploratorio deliberado a partir de entradas y condiciones de riesgo seleccionadas. Una muestra pequeña puede revelar patrones, pero no representa automáticamente toda la distribución de resultados del generador.
  2. Los controles de calidad rechazan candidatos que incumplen requisitos estrictos o que no sirven al propósito de juego.

Una evaluación útil no pregunta: «¿Cuántos resultados diferentes obtuvimos?». Pregunta:

  • ¿Qué resultados son válidos?
  • ¿Qué resultados producen decisiones de juego realmente distintas?
  • ¿Qué fallos se repiten lo suficiente para revelar un problema del generador?
  • ¿Qué resultados aceptados son técnicamente válidos, pero no merecen conservarse?

Rechazar no significa desperdiciar generación. El rechazo forma parte del diseño del generador. Sin embargo, una tasa de rechazo muy alta puede indicar que el generador explora un espacio de búsqueda deficiente o que sus restricciones se contradicen. Mide el rechazo e inspecciona fallos representativos en lugar de ocultarlos.

Tres categorías de evaluación

Categoría Pregunta Respuesta habitual
Validez estricta ¿El candidato cumple todas las invariantes obligatorias? Rechazar de inmediato si no las cumple
Propósito de juego ¿El candidato sostiene la decisión, el ritmo o el desafío buscado? Conservar, revisar o rechazar con un motivo
Valor de la variación ¿La diferencia cambia algo importante durante la partida? Agrupar muestras similares o conservar una clase distinta

2331. Modelo mental

Usa el modelo muestrear → clasificar → diagnosticar → restringir:

Crear una muestra deliberada
          ↓
Clasificar cada resultado: aceptar, rechazar o investigar
          ↓
Diagnosticar patrones entre los resultados
          ↓
Cambiar una restricción o un control de calidad
          ↓
Crear una nueva muestra de comparación

Para cada muestra, registra cuatro campos:

Campo Significado
Semilla o identificador Identifica la entrada; la reproducción exacta también requiere registrar la versión y la configuración del generador
Resultado de los controles Qué invariante o control pasó o falló
Resultado de propósito Qué decisión o experiencia respalda
Acción Conservar, rechazar o revisar el generador

Compara las muestras por el comportamiento que producen, no solo por su diferencia visual. Dos diseños pueden verse distintos y exigir la misma ruta, el mismo ritmo y la misma decisión. Del mismo modo, un cambio espacial pequeño puede crear una distinción táctica importante.

2332. Ejemplo concreto

Supón que un generador crea diseños de exploración con cinco salas. Sus invariantes exigen una ruta conectada entre la entrada y el objetivo, además de al menos una bifurcación opcional. El propósito es que la persona jugadora elija entre una ruta más segura y larga y otra más arriesgada y corta.

Una muestra de 20 candidatos produce tres clasificaciones que no se solapan:

  • Los 20 cumplen las invariantes estrictas de conectividad y bifurcación opcional.
  • 14 también superan el control de propósito de juego porque ofrecen una ruta segura y larga creíble y otra arriesgada y corta.
  • 4 no superan el criterio de separación entre rutas porque la bifurcación opcional se une de inmediato a la ruta principal.
  • 2 no superan el criterio de contraste de costes porque el objetivo solo puede alcanzarse atravesando la zona más peligrosa, lo que vuelve irrelevante la supuesta ruta segura.

Contar 20 resultados con validez estricta sugeriría una productividad saludable. Evaluar el propósito muestra otra realidad: solo 14 sostienen la decisión de ruta buscada. Los otros seis no fallan una invariante estricta, sino criterios separados de propósito de juego. La siguiente revisión no debería limitarse a pedir más salas. Debería añadir o ajustar un control que mida la separación entre rutas o el contraste de sus costes, y después comprobar si la colocación del peligro sigue permitiendo una alternativa creíble.

El control debe ser específico. «Haz que el diseño sea más interesante» no es una prueba útil. «La ruta opcional debe diferir de la ruta más corta en al menos dos segmentos de recorrido y tener una puntuación de exposición menor» sí es comprobable, aunque los umbrales exactos necesiten ajustes.

2333. Flujo de trabajo con IA

Usa la IA como compañera de análisis y revisión, no como juez final.

  1. Exporta o reúne una muestra etiquetada con semillas reproducibles. Incluye resultados aceptados y rechazados.
  2. Pide a la IA que agrupe los fallos según patrones observables. Exige que cite la evidencia de cada grupo y distinga hechos de hipótesis.
  3. Revisa tú la agrupación. Corrige cualquier categoría que confunda una diferencia visual con una variación de juego significativa.
  4. Pide a la IA dos o tres cambios de alcance reducido en las restricciones o controles. No aceptes una reescritura amplia del generador.
  5. Elige un cambio, aplícalo y crea una muestra de comparación con semillas nuevas y al menos una semilla que haya fallado antes como entrada de regresión. Conserva el artefacto original, la versión y la configuración del generador para disponer de evidencia exacta del antes y el después.
  6. Compara la tasa de aceptación, las categorías de fallo y los resultados de propósito. Conserva el cambio solo si mejora el objetivo sin romper una invariante existente.

Una petición útil es:

Aquí tienes una muestra etiquetada de diseños generados. Clasifica cada resultado según validez estricta, propósito de juego y variación significativa. Cita los identificadores de muestra para cada afirmación. Después propón un único control de calidad que responda al fallo de propósito más frecuente. No modifiques todavía el generador y no trates la novedad visual como valor jugable.

La responsabilidad sobre los criterios de aceptación sigue siendo tuya. La IA puede acelerar la clasificación y proponer hipótesis; no puede establecer por sí sola que un resultado sea divertido o tenga propósito a partir de una descripción.

2334. Error común

El error común es tratar cada resultado no idéntico como una variación valiosa. Cambiar posiciones, colores o formas de las salas puede crear novedad visual sin cambiar las decisiones de la persona jugadora. El error contrario consiste en rechazar resultados inusuales porque se apartan de un patrón familiar, aunque cumplan las invariantes y creen una alternativa útil. Evalúa el comportamiento y el propósito que produce la variación, no la cantidad de aleatoriedad empleada para crearla.

2335. Práctica guiada

Usa el generador de la lección anterior o el paquete de práctica que aparece a continuación. Ambas opciones evalúan la misma capacidad de clasificación y revisión; no necesitas un generador ejecutable. Si trabajas con diseños visuales, acompaña cada uno con una alternativa textual estructurada, como una lista de adyacencia o de rutas ordenadas que indique conexiones, costes y fallos observados.

Paquete de práctica listo para inspeccionar

Este paquete fijo utiliza una entrada E, un objetivo O y salas intermedias A–C. Cada ruta se expresa como una secuencia ordenada de nodos seguida de [coste, exposición]. La validez estricta exige una ruta conectada de E a O y una bifurcación opcional. El control de propósito exige rutas creíbles que contrasten una opción más segura y larga con otra más arriesgada y corta, además de una separación suficiente entre rutas.

Todas las filas originales comparten este registro de reproducibilidad: versión del generador TP-1.0; configuración C0. La configuración C0 indica que los grafos, rutas, costes y valores de exposición suministrados se usan tal como aparecen, sin reparar ni omitir semillas. Cita cada etiqueta original con el formato semilla | TP-1.0 | C0 | etiqueta | evidencia.

Semilla Resultado estructurado
S01 E-A-B-O [3,1]; E-C-O [2,3]
S02 E-A-B-O [3,2]; E-C-O [2,2]
S03 E-B-A-O [3,1]; E-A-O [2,3]; las rutas vuelven a unirse en A
S04 E-A-B; C-O; el objetivo está desconectado de la entrada
S05 E-A-B-O [3,2]; no hay bifurcación opcional
S06 E-A-B-O [3,4]; E-C-O [2,2]
S07 E-C-B-O [3,1]; E-A-O [2,4]
S08 E-A-B-O [3,2]; ramal sin salida E-C; no existe una segunda ruta hasta O
S09 E-A-O [2,1]; E-C-O [2,3]
S10 E-A-C-O [3,1]; E-B-O [2,3]
S11 E-A-B-O [3,2]; ciclo opcional A-C-A; no existe una ruta alternativa hasta O
S12 E-A-B-C-O [4,1]; E-C-O [2,4]

Subconjunto de referencia resuelto:

  • S01 — conservar: cumple ambas invariantes estrictas y ofrece una ruta más larga con menor exposición que la ruta corta.
  • S04 — rechazar: incumple la validez estricta porque no hay una ruta conectada de E a O.
  • S02 — investigar: cumple la validez estricta, pero la misma exposición elimina el contraste de riesgo; confirma el umbral de propósito antes de rechazarlo.

Clasifica por tu cuenta los demás resultados. Conserva este paquete original como evidencia previa al cambio y registra cualquier interpretación o resultado revisado en una comparación separada.

Si no dispones de un generador, crea esa comparación mediante esta revisión determinista en papel:

  • Versión revisada: TP-1.1.
  • Configuración revisada: C1 = C0 + control de elección de ruta.
  • Control de elección de ruta: conserva un candidato solo si cumple las dos invariantes estrictas originales, contiene dos rutas distintas de E a O que no vuelven a unirse antes de O, y la ruta larga cuesta al menos una unidad más y tiene al menos una unidad menos de exposición que la corta.
  • Orden de transformación: para cada semilla de S01 a S12, copia el resultado estructurado original; comprueba, en este orden, conectividad, bifurcación opcional, dos rutas distintas, separación entre rutas, contraste de coste y contraste de exposición; después añade ACEPTAR o RECHAZAR: primera comprobación fallida. No alteres nodos, costes ni valores de exposición.
  • Etiqueta revisada obligatoria: semilla | TP-1.1 | C1 | ACEPTAR/RECHAZAR | primera comprobación fallida o evidencia de cumplimiento.

Este procedimiento produce el paquete completo posterior al cambio a partir de las semillas suministradas, sin un generador ejecutable. Conserva ambas versiones para que cada comparación pueda vincularse con la misma entrada registrada.

Parte A — Construye una muestra

Usa el paquete suministrado o reúne entre 12 y 20 candidatos de tu generador. Completa esta lista de reproducibilidad antes de clasificarlos:

  • Fija y registra la versión y la configuración del generador.
  • Elige y registra las semillas antes de inspeccionar los resultados.
  • Usa todos los resultados seleccionados, no solo tus favoritos.
  • Si las entradas tienen rangos o límites de riesgo conocidos, incluye condiciones bajas, habituales, altas y de frontera.
  • Registra cada exclusión y su motivo.
  • Incluye al menos dos resultados rechazados y uno que cumpla las invariantes estrictas, pero cuyo propósito de juego sea dudoso.
  • Conserva cada artefacto original o representación estructurada junto con su semilla, versión y configuración.

Trata el conjunto como una muestra exploratoria, no como prueba de fiabilidad estadística. Mantenlo separado de las semillas de regresión usadas para revisar fallos conocidos. Las afirmaciones sobre frecuencias o fiabilidad requieren pruebas de distribución más amplias.

Parte B — Clasifica los candidatos

Usa esta plantilla de evaluación procedural:

Semilla Resultado de invariantes Decisión de juego buscada ¿De qué muestra se diferencia de forma significativa? Acción Evidencia

Usa solo tres acciones: conservar, rechazar o investigar. Escríbelas como etiquetas textuales y no las distingas únicamente mediante colores. Completa la tabla en un documento o una hoja de cálculo accesible mediante teclado y con encabezados explícitos. Investigar es apropiado cuando el candidato pasa las comprobaciones estrictas, pero su propósito de juego no está claro.

Parte C — Toma una decisión sobre una restricción

Identifica el fallo repetido más importante. Si usas un generador ejecutable, elige una respuesta:

  • Añadir o endurecer un control de calidad estricto.
  • Cambiar una restricción del generador para reducir la probabilidad del fallo.
  • Mantener la regla actual y documentar por qué la variación observada es aceptable.

Si solo usas el paquete fijo, adopta como cambio seleccionado el control de elección de ruta de C1. Usa tus clasificaciones de C0 para explicar qué fallo repetido aborda y qué invariantes existentes debe conservar.

Escribe la decisión con este formato:

Debido a [evidencia de la muestra], voy a [cambiar o conservar una regla]. Espero mejorar [jugabilidad o propósito] sin debilitar [invariante existente]. Lo comprobaré mediante [comparación específica].

Parte D — Ejecuta una comparación

Aplica únicamente el cambio elegido. Si usas un generador ejecutable, crea una segunda muestra con semillas nuevas y reutiliza al menos una semilla fallida como entrada de regresión; conserva las dos versiones y configuraciones. Si usas el paquete fijo, aplica la transformación determinista C1 a las 12 semillas originales y compara cada registro TP-1.1 | C1 con su registro correspondiente TP-1.0 | C0. Compara:

  • La tasa original de validez estricta y la tasa revisada de aceptación del control completo, informadas por separado.
  • El número y el tipo de fallos repetidos antes y después de añadir el control.
  • El número de clases de variación significativa conservadas.
  • Si la decisión de juego buscada está presente en cada candidato conservado.

No declares éxito solo porque los registros revisados contengan más resultados aceptados. Indica si conviene conservar o revertir C1, incluida cualquier variación válida que rechace y cualquier fallo de propósito que todavía permita.

2336. Validación / evidencia

Has completado el laboratorio cuando puedas señalar:

  1. Una muestra reproducible que contenga candidatos aceptados y rechazados.
  2. Una tabla de clasificación con evidencia para cada decisión de conservar, rechazar o investigar.
  3. Una decisión documentada sobre una restricción o un control de calidad, vinculada a un patrón de fallo repetido.
  4. Una comparación antes-después que informe la tasa de aceptación y las categorías de fallo.
  5. Una conclusión escrita que indique si la revisión mejoró el propósito de juego, no solo la cantidad de resultados.

Un resultado sólido puede incluir candidatos rechazados. El rechazo es aceptable cuando el motivo está claro, el control mide un requisito real y el generador todavía puede producir una gama útil de resultados válidos.

Rúbrica de evaluación práctica

El cuestionario funciona como comprobación de conocimientos. Para la evaluación práctica, entrega la tabla, los artefactos conservados de antes y después, el registro de reproducibilidad y la decisión final. Puntúa cada dimensión de 0 a 2.

Dimensión 0 1 2
Clasificación Faltan categorías o están confundidas La mayoría de los candidatos está clasificada, con alguna inconsistencia Todos separan claramente validez estricta, propósito de juego y valor de variación
Trazabilidad de la evidencia Las afirmaciones no pueden vincularse a resultados Algunas afirmaciones citan semillas u observaciones Cada decisión cita una semilla, un artefacto y un resultado observable
Cambio elegido No hay cambio o no se relaciona con la evidencia Aborda un fallo, pero es amplio o está débilmente justificado Una restricción o un control acotado responde directamente al patrón diagnosticado
Comparación controlada No existe una comparación utilizable Cambian varias condiciones o faltan medidas importantes Se prueba un único cambio con configuraciones registradas y, según la opción elegida, se usan semillas nuevas más una semilla de regresión con el generador ejecutable, o se transforman de forma determinista todas las semillas suministradas y se vincula cada registro revisado con su original en el paquete fijo
Conservación de invariantes Se ignoran o rompen invariantes existentes Las invariantes se comprueban de forma incompleta Se comprueban todas y se conservan, o se identifica explícitamente cualquier regresión
Decisión final La decisión de conservar o revertir no está justificada La decisión utiliza evidencia parcial La decisión se apoya en tasas de aceptación, categorías de fallo, propósito de juego y limitaciones

Criterio de entrega: obtén al menos 9 de 12 puntos, sin ningún cero en trazabilidad de la evidencia ni conservación de invariantes. Si no alcanzas el criterio, revisa y vuelve a entregar la evidencia práctica.

2337. Puntos clave

  • El muestreo revela patrones que una única salida favorita puede ocultar.
  • La validez estricta, el propósito de juego y el valor de la variación son categorías distintas.
  • El rechazo es una parte diseñada de la generación procedural, no necesariamente un defecto.
  • Una revisión significativa cambia una sola restricción o control y compara la evidencia antes y después.
  • La diferencia visual no basta; la variación debe afectar la partida de forma intencionada.

2338. Siguiente lección

Continúa con el Módulo 5.13 — Pensamiento sistémico. Usa la evidencia de esta evaluación —especialmente la relación entre restricciones, controles de rechazo y propósito de juego— como punto de partida para analizar el sistema más amplio, en lugar de tratar el generador como una función aislada.

2339. Comprobación

Responde estas preguntas por tu cuenta antes de leer las respuestas.

¿Cuál es el propósito principal de muestrear un conjunto de resultados generados?

  • A. Producir la mayor cantidad posible de resultados.
  • B. Seleccionar únicamente los resultados más atractivos visualmente.
  • C. Revelar patrones representativos de validez, fallo y variación significativa.
  • D. Eliminar la necesidad de usar criterios de propósito de juego.
Mostrar respuesta y explicación

Respuesta: Revelar patrones representativos de validez, fallo y variación significativa.

Por qué: Una muestra deliberada ayuda a revelar fallos recurrentes de validez y a distinguir la variación jugable significativa de la diferencia superficial. Su función principal no es contar cuántos resultados pueden producirse.

Un candidato supera las comprobaciones de conectividad, pero vuelve irrelevante la decisión de juego buscada. ¿Cómo debería clasificarse inicialmente?

  • A. Como aceptable automáticamente porque superó una invariante.
  • B. Como cuestionable o como un fallo de propósito que requiere investigación.
  • C. Como valioso únicamente porque es diferente visualmente.
  • D. Como prueba de que deben eliminarse todos los controles de calidad.
Mostrar respuesta y explicación

Respuesta: Como cuestionable o como un fallo de propósito que requiere investigación.

Por qué: Superar una invariante estricta establece la validez técnica, pero no necesariamente el propósito de juego. El candidato debe investigarse o rechazarse según los criterios de propósito definidos.

¿Qué revisión establece el control de calidad más claro para un generador cuyo objetivo es crear decisiones de ruta significativas?

  • A. Hacer que el diseño sea más interesante.
  • B. Usar más valores aleatorios en cada sala.
  • C. Crear tantas formas de sala diferentes como sea posible.
  • D. Exigir que la ruta opcional difiera de la ruta más corta en al menos dos segmentos de recorrido y cumpla el contraste de coste buscado.
Mostrar respuesta y explicación

Respuesta: Exigir que la ruta opcional difiera de la ruta más corta en al menos dos segmentos de recorrido y cumpla el contraste de coste buscado.

Por qué: Un control de calidad útil es específico y comprobable. El requisito de separación y contraste de coste mide directamente si el diseño generado puede sostener una decisión significativa.

¿Por qué debería una muestra de comparación reutilizar al menos una semilla que había fallado anteriormente?

  • A. Para comprobar si la revisión resuelve un fallo conocido, en lugar de funcionar solo con una aleatoriedad nueva.
  • B. Para garantizar que todos los resultados serán aceptados.
  • C. Para aumentar el tamaño aparente de la muestra sin registrar las semillas.
  • D. Para evitar comparar las categorías de fallo.
Mostrar respuesta y explicación

Respuesta: Para comprobar si la revisión resuelve un fallo conocido, en lugar de funcionar solo con una aleatoriedad nueva.

Por qué: Reutilizar una semilla fallida permite comprobar de forma controlada si la revisión cambia un caso problemático conocido. Las semillas nuevas sirven para evaluar el comportamiento general, pero no sustituyen esta comparación específica.

Apoyar