¿Ha mejorado de verdad o es ruido? El número que deberías calcular antes de celebrar nada
Tu cliente pasó de 82 a 85 kg en el test. ¿Es una mejora real o ruido? Cómo calcular el error de tu test y el umbral de cambio real, con fórmulas simples.
Publicado por
Lectura relacionada
Medir la fatiga con un test semanal: qué puedes concluir y qué no
Un test semanal de 3 minutos puede darte información de carga y recuperación. También puede engañarte. Cómo montarlo bien y qué conclusiones no puedes sacar.
Valorar la fuerza en clientes de más de 60: qué medir y con qué referencias
Agarre, levantarse de la silla, velocidad de marcha: la batería de valoración para clientes mayores, con los puntos de corte del consenso europeo y sus límites.
Entrenar en isométrico: qué mejora de verdad, en qué ángulo y cuánto
Ángulo, intensidad e intención: las tres variables que determinan qué consigues con el trabajo isométrico. Con prescripciones concretas y sus límites.
En enero mediste a tu cliente: 82 kg de fuerza máxima en el test. En marzo vuelves a medir: 85 kg.
Tres kilos más. Ocho semanas de trabajo. Le mandas el mensaje: “¡Has mejorado un 3,7%!”.
Y aquí viene la parte incómoda: no lo sabes. Todavía no.
Porque hay una posibilidad muy real de que tu cliente no haya mejorado nada y que esos 3 kg sean simplemente el margen de error de tu test. Es decir: ruido.
Este artículo va de cómo distinguir una cosa de la otra. Es, probablemente, el concepto más útil y peor conocido de toda la valoración física.
🎯 Todo test tiene un margen de error
Haz este experimento: mide a la misma persona dos veces en la misma tarde, con el mismo protocolo, con 20 minutos de descanso entre medida y medida.
No te va a salir el mismo número. Nunca sale.
Puede variar por el posicionamiento, por cuánto ha calentado, por cómo has dado la instrucción, por si esa mañana durmió mal, por dónde tenía la mano en el agarre. Todas esas microdiferencias se suman en lo que se llama error típico de medida (typical error, o error estándar de medida, SEM)[1][2].
El error típico no es un fallo tuyo. Es una propiedad del test. Existe siempre, en todos los tests, hechos por todo el mundo. Un buen test tiene poco; un test mal estandarizado tiene mucho. Pero cero, jamás.
Y aquí está la idea clave:
Un cambio solo es informativo si es más grande que el error del test.
Si tu test tiene un margen de ±3 kg y observas un cambio de 3 kg, no has observado nada. Has observado el margen.
📏 Cómo calcular el error de tu test (sin ser estadístico)
Esto lo puedes hacer una vez y te sirve para siempre, mientras no cambies el protocolo.
Necesitas: 10 personas (tus propios clientes valen), medidas dos veces con el mismo protocolo, separadas entre 2 y 7 días, sin cambios de entrenamiento entre medio.
Pasos:
- Apunta las dos medidas de cada persona:
medida 1ymedida 2. - Calcula la diferencia de cada persona (medida 2 − medida 1). Ojo: con su signo, positivas y negativas.
- Calcula la desviación típica de esas diferencias (en Excel:
=DESVEST.M(rango)). - Divide entre 1,41 (que es √2). Eso es tu error típico.
Error típico = Desviación típica de las diferencias ÷ 1,41
Si además lo divides entre la media de todas las medidas y lo multiplicas por 100, tienes tu coeficiente de variación (CV) en porcentaje, que es la forma más cómoda de hablar de esto[2].
🚦 El umbral: cuándo puedes decir “ha mejorado”
Con el error típico ya puedes calcular el cambio mínimo detectable: el cambio a partir del cual puedes afirmar, con un 95% de confianza, que algo real ha pasado[1].
Cambio mínimo detectable ≈ 2,77 × error típico
(El 2,77 sale de 1,96 × √2. No hace falta que lo recuerdes, solo que lo apliques.)
Traducido a porcentajes, para que lo tengas a mano:
| Si el CV de tu test es… | Necesitas un cambio de al menos… |
|---|---|
| 3% | ~8% |
| 5% | ~14% |
| 8% | ~22% |
| 10% | ~28% |
Vuelve al ejemplo del principio. 82 → 85 kg es un 3,7% de cambio. Si tu test tiene un CV del 5% (algo perfectamente normal en un test bien hecho), necesitarías un 14% para poder afirmar con seguridad que mejoró. Ese cambio del 3,7% cabe entero dentro del ruido.
No significa que no haya mejorado. Significa que tu test no puede demostrarlo. Que es una cosa muy distinta y mucho más honesta.
⚖️ “¿Es real?” y “¿importa?” son dos preguntas diferentes
Aquí hay un matiz que casi nadie explica y que te va a ahorrar discusiones.
- El cambio mínimo detectable responde a: ¿este cambio es real o es ruido? Es exigente (95% de confianza).
- El cambio mínimo relevante (smallest worthwhile change) responde a: ¿este cambio importa en la práctica? Se suele estimar como 0,2 × la desviación típica del grupo[3].
Y aquí aparece un problema real que conviene mirar de frente: en muchos tests, el error es mayor que el cambio que nos interesaría detectar. Es decir, el test no tiene resolución suficiente para ver lo que queremos ver.
Cuando eso pasa tienes tres salidas honestas:
- Reducir el error: estandarizar mejor (ver el artículo sobre las 7 cosas que arruinan un test), promediar 3 intentos en vez de quedarte con el mejor, familiarizar al cliente antes de medir de verdad.
- Alargar el plazo entre medidas: si mides cada 12 semanas en vez de cada 4, el cambio real tiene tiempo de superar el ruido.
- Decirlo. “Este test no tiene precisión suficiente para detectar cambios pequeños” es una frase profesional, no una debilidad.
🗣️ Cómo se lo cuentas al cliente (sin desinflarle)
Esta es la parte que más se agradece en el día a día. Dos versiones:
Cuando el cambio no supera el umbral:
“Has pasado de 82 a 85 kg. Mi test tiene un margen de unos ±3 kg, así que este cambio está dentro del margen: no puedo asegurarte todavía que sea una mejora real. Lo que sí puedo decirte es que no has bajado, que en mitad de un bloque de volumen ya es información. Volvemos a medir en seis semanas.”
Cuando sí lo supera:
“Has pasado de 82 a 95 kg. Eso está muy por encima del margen de error del test: esto es una mejora real, no una casualidad de la medición.”
Fíjate en lo que has hecho: no has prometido nada, no has exagerado nada, y has salido de la conversación con más autoridad, no con menos. Ese es exactamente el terreno donde un entrenador que mide gana frente a uno que no mide.
✅ Para llevar
- Todo test tiene error. La pregunta no es si lo tiene, sino cuánto.
- Calcula tu error típico una vez, con 10 clientes medidos dos veces. Te sirve para siempre.
- Umbral rápido: cambio mínimo detectable ≈ 2,77 × error típico.
- Con un CV del 5%, necesitas ~14% de cambio para hablar de mejora con seguridad.
- Si el cambio no supera el umbral, dilo. Es más profesional que celebrar ruido.
📥
Plantilla de Excel "¿Es real esta mejora?"
Introduces las dos medidas de 10 clientes y te devuelve tu error típico, tu CV y tu umbral de cambio real, con el texto ya redactado para el informe.
Probar la calculadora📬
¿Te ha servido?
En Medir para saber mando cada dos semanas un test explicado, cómo interpretarlo y qué NO se puede concluir con él. Nada de promesas: solo criterios de medición que puedes usar el lunes con tu primer cliente.
📚 Bibliografía
- [1]Weir JP. Quantifying test-retest reliability using the intraclass correlation coefficient and the SEM. Journal of Strength and Conditioning Research. 2005;19(1):231-240. doi:10.1519/15184.1
- [2]Hopkins WG. Measures of reliability in sports medicine and science. Sports Medicine. 2000;30(1):1-15. doi:10.2165/00007256-200030010-00001
- [3]Turner A, Brazier J, Bishop C, Chavda S, Cree J, Read P. Data analysis for strength and conditioning coaches: using Excel to analyze reliability, differences, and relationships. Strength and Conditioning Journal. 2015;37(1):76-83. doi:10.1519/SSC.0000000000000113
Descarga gratis el Protocolo Línea de Base
Descargar protocolo gratis