Lección 111 de 170

Los datos son evidencia, no un veredicto

Curso de desarrollo de videojuegos con IA

Aprende a interpretar datos de balance sin confundir correlación con causalidad ni métricas con la intención de diseño.

1611. Identidad de la lección

Módulo
4.5 — Equilibrio con datos
Lección
Los datos son evidencia, no un veredicto
Tipo académico
Concepto
Tipo de esquema
texto
Orden
Lección 1 del módulo
Tiempo estimado
30–40 minutos, incluida la práctica

1612. Objetivo de aprendizaje

Después de esta lección, podrás identificar qué conclusiones respalda un conjunto de datos de balance, qué conclusiones no respalda y qué evidencia adicional hace falta antes de cambiar un diseño.

1613. Por qué importa

Un conjunto de datos puede revelar un patrón sin explicar su causa. Si un arma tiene una tasa baja de finalización, el problema puede estar en su coste, su disponibilidad, el encuentro en el que se usa o la comprensión que tiene el jugador de su función. Cambiar la variable equivocada puede ocultar el problema original y crear otro. Cuando trabajas con IA, necesitas formular el diagnóstico con precisión: una instrucción ambigua puede producir una implementación eficaz de un cambio equivocado.

1614. Conocimientos previos

Debes poder especificar un conjunto mínimo de eventos de gameplay y distinguir los eventos observables de las interpretaciones. Esta lección depende directamente de 4.4 L2 — Specify a minimal gameplay event set. También debes reconocer la diferencia entre un valor de economía, un umbral de progresión y un contrato de dificultad.

1615. Concepto central

Los datos de balance son evidencia para tomar una decisión, no la decisión en sí. Un análisis útil triangula tres elementos:

  1. Patrón observado: ¿Qué ocurrió y con qué frecuencia?
  2. Explicación posible: ¿Qué mecanismos podrían producir ese patrón?
  3. Intención de diseño: ¿Qué experiencia o intercambio debía crear el sistema?

Una conclusión sólida mantiene separados estos niveles. Por ejemplo:

  • Observación: Los jugadores que obtienen el escudo lo usan menos que quienes obtienen el botiquín.
  • Explicaciones posibles: El escudo puede ser demasiado caro, su caso de uso puede no estar claro o las situaciones que lo recompensan pueden ser poco frecuentes.
  • Pregunta de diseño: ¿El escudo debe ser una herramienta defensiva habitual, una respuesta situacional o una opción de emergencia de alto valor?

El conjunto de datos respalda la observación. Las explicaciones son hipótesis. Un mecanismo plausible, como que el escudo sea demasiado caro para llevarlo a un combate, puede hacer más creíble una hipótesis que otra. Un patrón observacional repetido también puede reforzar una hipótesis si aparece en contextos relevantes. Ni un mecanismo plausible ni la repetición de una observación demuestran por sí solos la causalidad. Para obtener un respaldo causal más sólido hace falta una comparación controlada o diseñada de otra forma rigurosa que reduzca las explicaciones alternativas. La pregunta de diseño requiere conocer la intención y realizar una investigación adicional.

Los datos observacionales tienen límites concretos: los jugadores deciden qué comprar y qué usar, las situaciones varían y puede que no se registren variables importantes. Estos datos pueden mostrar asociaciones y ayudar a generar hipótesis, pero normalmente no pueden aislar por sí solos el efecto de una variable de balance.

1616. Modelo mental

Utiliza el triángulo Evidencia–Explicación–Intención antes de modificar el balance:

Vértice Pregunta Qué puede respaldar
Evidencia ¿Qué se midió? Una descripción del patrón dentro del alcance de los datos
Explicación ¿Qué pudo causarlo? Una o más hipótesis comprobables, con distintos grados de plausibilidad
Intención ¿Qué debería permitir o fomentar el sistema? Un criterio para evaluar los cambios propuestos

Después, clasifica la relación entre las variables:

  • Correlación: Dos cosas varían juntas. Esto respalda una asociación en el contexto observado, pero no demuestra que una haya causado la otra.
  • Hipótesis causal: Una explicación propuesta según la cual un factor produce un cambio en otro. Un mecanismo creíble o un patrón observacional repetido puede hacerla más plausible, pero ninguno la demuestra.
  • Respaldo causal: Evidencia procedente de una comparación controlada o diseñada de otra forma rigurosa que reduzca las explicaciones alternativas. Esto ofrece un respaldo más sólido para una afirmación causal, aunque todavía exige atender al alcance y las limitaciones.
  • Intención de diseño: La experiencia que el sistema pretende crear. La intención puede justificar la investigación de un patrón, pero no se puede deducir de los números por sí sola ni sustituye a la evidencia causal.

Una formulación práctica es:

“Los datos muestran X en el contexto Y. Esto es compatible con A y B. Un mecanismo plausible o un patrón repetido puede hacer que A merezca ser comprobada, pero los datos observacionales no demuestran que A haya causado el resultado. La experiencia prevista es Z. Antes de cambiar D, debemos recoger o comparar C.”

1617. Ejemplo concreto

Considera este conjunto de datos ficticio sobre un objeto defensivo:

  • 100 adquisiciones registradas
  • 62 usos
  • 38 adquisiciones sin uso
  • Los jugadores que usaron el objeto completaron el siguiente encuentro en el 78 % de los casos
  • Los jugadores que no lo usaron completaron el siguiente encuentro en el 55 % de los casos

Los datos respaldan que el uso del objeto y la finalización del siguiente encuentro están correlacionados en esta muestra. No demuestran que el objeto haya causado la mayor tasa de finalización. Es posible que los jugadores lo usen cuando ya tienen más recursos, más experiencia o una posición más favorable.

Supón que la misma asociación aparece en varios tipos de encuentro comparables y que el objeto está diseñado para contrarrestar las amenazas concretas presentes en ellos. Ese patrón repetido y ese mecanismo plausible hacen más creíble la hipótesis causal de que el objeto contribuye a mejorar los resultados. Aun así, no demuestran la causalidad, porque los jugadores pueden seguir diferenciándose en aspectos que no se han medido.

Un respaldo causal más sólido requeriría una comparación controlada o diseñada de otra forma rigurosa; por ejemplo, comparar estados de encuentro similares en los que la disponibilidad o el uso del objeto se asignen o se restrinjan, manteniendo comparables las condiciones relevantes. Incluso entonces, la conclusión debe limitarse a los contextos representados por la comparación.

Algunas investigaciones siguientes podrían ser:

  • Comparar jugadores con salud, recursos y estado de encuentro similares.
  • Comprobar si el objeto estaba disponible antes de los encuentros en los que resultaba útil.
  • Revisar si los jugadores reconocían que el objeto respondía a la amenaza.
  • Examinar si su función prevista es la prevención frecuente o la recuperación ocasional.

Un veredicto apresurado sería: “El objeto es demasiado poderoso; reduce su efecto”. Una conclusión disciplinada sería: “El uso del objeto se asocia con una mejor finalización del siguiente encuentro. Las observaciones repetidas y la función del objeto hacen plausible una contribución causal, pero los datos observacionales actuales no aíslan ni demuestran ese efecto. Primero hay que comparar contextos equivalentes y verificar su función prevista”.

1618. Error común

El error común es tratar una explicación plausible como si fuera una prueba. Un mecanismo que suena convincente o un patrón que se repite en datos observacionales puede aumentar la confianza en una hipótesis causal sin demostrar la causalidad. Una tasa baja de selección no significa automáticamente que un objeto sea débil. Una tasa alta de victoria no significa automáticamente que esté desequilibrado a favor del jugador. Las métricas deben interpretarse según su población, contexto, limitaciones de la muestra, diferencias no medidas y función de diseño prevista. Las afirmaciones causales más sólidas requieren una comparación controlada o diseñada de otra forma rigurosa, no solo observación.

1619. Práctica guiada

Analiza tanto el conjunto de datos etiquetado como las notas de playtest que lo acompañan. Mantén separadas tres capas: lo que registra el conjunto de datos, lo que sugieren las notas y lo que pretende el diseño. No uses ninguna de las dos fuentes como prueba automática de causalidad y no introduzcas en este ejercicio una intervención de balance ni un modelo de implementación.

Conjunto de datos etiquetado

Etiqueta Medición Resultado Alcance o limitación
D1 Compras de la herramienta cara 80 partidas Solo partidas en las que la herramienta estaba disponible
D2 Partidas abandonadas después de comprarla 32 de 80 (40 %) Registrado después de la compra; no se registró la causa del abandono
D3 Compras de la herramienta barata 120 partidas Pueden estar representados jugadores y combinaciones de encuentros diferentes
D4 Partidas abandonadas después de comprarla 24 de 120 (20 %) No se hizo correspondencia por salud, recursos o estado del encuentro
D5 Uso de la herramienta antes del abandono 18 de 32 partidas con la herramienta cara No se registraron el momento ni la finalidad del uso

Notas de playtest

  • Dos testers dijeron que la herramienta cara parecía útil, pero no tenían claro cuándo gastarla.
  • Un tester compró la herramienta cara justo antes de un encuentro de mucho daño; otro la conservó durante varias salas de baja amenaza.
  • Los testers con menos recursos iniciales describieron la compra como arriesgada.
  • Las notas cubren cinco sesiones observadas y no constituyen una muestra representativa.

Escribe un análisis breve utilizando el triángulo Evidencia–Explicación–Intención.

  1. Formula una afirmación que D1–D5 respalden directamente y limita la afirmación al alcance del conjunto de datos.
  2. Formula una afirmación respaldada por las notas de playtest e indica que su muestra es pequeña y no representativa.
  3. Enumera al menos tres explicaciones posibles para la mayor tasa de abandono, combinando la evidencia de ambas fuentes sin presentar ninguna explicación como demostrada.
  4. Identifica un mecanismo plausible o un patrón observacional repetido que haga más creíble una explicación, y explica por qué todavía no demostraría la causalidad.
  5. Formula una pregunta sobre la intención de diseño que deba responderse.
  6. Elige una comparación, un evento adicional o una comprobación cualitativa que ayude a separar las explicaciones.
  7. Decide si la acción inmediata correcta es cambiar el valor de balance, recoger más evidencia o revisar la comunicación al jugador. Justifica la decisión a partir del conjunto de datos y de las notas de playtest.

Tu decisión debe distinguir lo medido de lo inferido. No recomiendes un cambio numérico solamente porque un resultado sea peor que otro. No presentes un mecanismo o un patrón repetido como una prueba, salvo que la evidencia proceda de una comparación controlada o diseñada de otra forma rigurosa.

1620. Validación / evidencia

Tu respuesta es suficiente cuando contiene:

  • Una observación del conjunto de datos limitada al alcance real de D1–D5.
  • Una observación del playtest limitada a la muestra pequeña de las notas.
  • Tres explicaciones plausibles, identificadas claramente como hipótesis.
  • Una distinción explícita entre correlación y causalidad.
  • Un mecanismo o patrón observacional repetido identificado como apoyo a la plausibilidad, no como prueba.
  • Una pregunta sobre la intención de diseño.
  • Una comparación, evento o comprobación cualitativa adicional que reduzca la incertidumbre.
  • Una decisión justificada sobre cambiar, investigar o aclarar.

Una respuesta sólida puede decir “la evidencia actual no es suficiente” y explicar exactamente qué información falta. También debe reservar una afirmación causal más fuerte para una comparación controlada o diseñada de otra forma rigurosa, indicando qué demostraría y qué no demostraría esa comparación.

1621. Ideas clave

  • Los datos describen patrones; no los explican automáticamente.
  • Correlación no equivale a prueba de causalidad.
  • Un mecanismo plausible o un patrón observacional repetido puede hacer más creíble una hipótesis causal, pero no puede demostrarla por sí solo.
  • Las comparaciones controladas o diseñadas de otra forma rigurosa ofrecen un respaldo causal más sólido que los datos observacionales aislados.
  • Las notas de playtest aportan contexto e hipótesis, pero sus límites de muestra y selección deben permanecer visibles.
  • La intención de diseño es un criterio de evaluación, no una conclusión escondida en los datos.
  • Un cambio de balance debe seguir a un diagnóstico justificado, no simplemente a una métrica preocupante.

1622. Próxima lección

Continúa con 4.5 L2 — Toma una decisión de balance reversible.

1623. Comprobación

Responde estas preguntas por tu cuenta antes de leer las respuestas.

¿Qué establece una correlación entre el uso de un objeto y la finalización de un encuentro?

  • A. El uso del objeto causó la mayor tasa de finalización.
  • B. El objeto debe debilitarse inmediatamente.
  • C. Las dos mediciones varían juntas en la muestra observada.
  • D. La función prevista del objeto ya está confirmada.
Mostrar respuesta y explicación

Respuesta: Las dos mediciones varían juntas en la muestra observada.

Por qué: La correlación establece que las mediciones varían juntas en el contexto observado. Un mecanismo plausible o un patrón observacional repetido puede hacer más creíble una hipótesis causal, pero ninguno demuestra la causalidad. Un respaldo causal más sólido requiere una comparación controlada o diseñada de otra forma rigurosa.

¿Cuál de estas afirmaciones es una observación y no una explicación?

  • A. Los jugadores no entendieron la función del objeto.
  • B. El objeto se adquirió 100 veces y se usó 62 veces.
  • C. El objeto es demasiado caro para su función.
  • D. El encuentro no crea suficientes oportunidades para usar el objeto.
Mostrar respuesta y explicación

Respuesta: El objeto se adquirió 100 veces y se usó 62 veces.

Por qué: Las cantidades de adquisiciones y usos describen eventos medidos. Las demás opciones proponen explicaciones para esos eventos; incluso una explicación plausible sigue siendo una hipótesis hasta contar con evidencia más sólida.

¿Cuál es el siguiente paso más sólido cuando una métrica muestra un patrón preocupante, pero siguen siendo posibles varias causas?

  • A. Aplicar el cambio numérico más grande que pueda mejorar la métrica.
  • B. Elegir la explicación más familiar y tratarla como confirmada.
  • C. Ignorar la métrica porque la evidencia cuantitativa nunca es útil.
  • D. Recoger o comparar evidencia que permita distinguir entre las causas plausibles.
Mostrar respuesta y explicación

Respuesta: Recoger o comparar evidencia que permita distinguir entre las causas plausibles.

Por qué: Cuando el diagnóstico es incierto, el siguiente paso debe reducir la incertidumbre. Una comparación controlada o diseñada de otra forma rigurosa es más sólida para evaluar la causalidad que un patrón observacional aislado, mientras que una comprobación cualitativa dirigida puede aclarar un problema de comunicación.

¿Cómo debe utilizarse la intención de diseño durante el análisis de balance?

  • A. Como criterio para juzgar si un patrón observado es deseable.
  • B. Como prueba de que la explicación del conjunto de datos es correcta.
  • C. Como sustituto de observar el comportamiento del jugador.
  • D. Como garantía de que un cambio de balance tendrá el efecto deseado.
Mostrar respuesta y explicación

Respuesta: Como criterio para juzgar si un patrón observado es deseable.

Por qué: La intención de diseño proporciona el estándar con el que se evalúa un patrón. No demuestra una causa, no sustituye a la evidencia observacional ni garantiza el resultado de un cambio.

Apoyar