3 Constructos y Variables Latentes en Psicometría
La psicometría no es solo una colección de técnicas estadísticas. También constituye una estructura para conectar conceptos psicológicos con datos observables. Este capítulo se centra en una de las ideas más importantes que sustentan la psicometría moderna: la variable latente reflexiva.
Al finalizar este capítulo, deberá ser capaz de distinguir un constructo de una variable latente reflexiva y de un indicador, explicar por qué el ACP no es un modelo de variable latente, comparar representaciones reflexivas, formativas, de red y de clases latentes, y comprender por qué algunos modelos reflexivos implican restricciones comprobables, como las tétradas nulas.
3.1 Por Qué Importan las Variables Latentes Reflexivas
La psicometría se ocupa de la medición y de la representación cuantitativa de atributos psicológicos, comportamientos, desempeño y emociones. Por tanto, los problemas de medición no son periféricos a la ciencia psicológica: si la relación entre un atributo teórico y las puntuaciones observadas está mal especificada, las conclusiones sustantivas también pueden volverse inciertas (Borsboom et al., 2004; Cronbach & Meehl, 1955; Messick, 1989).
Los modelos psicométricos modernos proporcionan un lenguaje para hacer estas relaciones más explícitas. Nos obligan a preguntar qué representa una puntuación observada, por qué los indicadores covarían y qué supuestos son necesarios para interpretar psicológicamente esa covariación (Borsboom, 2006). Esta es una de las razones por las que el modelado psicométrico es más que una etapa técnica realizada después de la recogida de datos: el modelo de medición forma parte de la teoría sustantiva.
Un modelo estadístico puede ajustarse bien a los datos y aun así ser una representación inadecuada del fenómeno. La elección del modelo debe derivarse de la teoría sustantiva y de la interpretación pretendida de las puntuaciones, y no únicamente de los índices de ajuste.
3.2 Dos Errores Conceptuales Comunes
3.2.1 El ACP no es un modelo reflexivo de variable latente
Una fuente común de confusión es el uso del análisis de componentes principales (ACP) cuando la pregunta de investigación se refiere a variables latentes. El ACP es un método de reducción de datos: los componentes son combinaciones ponderadas de las variables observadas. No postula una causa común no observada que genere los indicadores (Bartholomew, 2004).
Esto no convierte al ACP en un mal método. El problema surge cuando un componente principal se interpreta como si constituyera automáticamente evidencia de un atributo psicológico latente reflexivo, en lugar de una representación formativa. Si la afirmación científica se refiere a una variable latente, el modelo estadístico debe contener una estructura de variable latente que corresponda a esa afirmación.
3.2.2 Las diferencias observadas entre grupos no son automáticamente diferencias en el constructo
Un segundo error ocurre cuando las diferencias de puntuaciones observadas entre grupos se interpretan directamente como diferencias en el atributo psicológico. Tales comparaciones requieren supuestos de invariancia de medición: el modelo de medición debe operar de forma comparable entre los grupos que se comparan (Mellenbergh, 1989; Meredith, 1993; Millsap & Everson, 1993).
Sin esta evidencia, una diferencia entre grupos en una puntuación observada puede reflejar una diferencia en el atributo objetivo, una diferencia en el funcionamiento del instrumento entre los grupos o alguna combinación de ambas. Esta cuestión se desarrolla en detalle en el capítulo posterior sobre invariancia de medición.
3.3 Por Qué Esto Es Difícil en la Práctica
Los modelos psicométricos suelen hacer supuestos que son fáciles de ignorar cuando solo se analizan puntuaciones totales. Las cuestiones sobre dimensionalidad, invariancia de medición, independencia local y la interpretación causal de variables latentes pueden convertirse rápidamente en cuestiones sobre la propia teoría del fenómeno (Borsboom, 2006).
Esto es exigente porque el modelado estadístico no puede decidir estas cuestiones por sí solo. Los investigadores necesitan una definición defendible del constructo, una explicación plausible de por qué los indicadores deberían relacionarse y evidencias empíricas capaces de poner a prueba esos supuestos. La aparente complejidad de la psicometría es, por tanto, en parte una consecuencia de tomarse en serio las afirmaciones de medición.
3.4 Constructos, Referentes y Variables Latentes
Los conceptos científicos ayudan a los investigadores a organizar fenómenos y a comunicarse sobre ellos. Sus significados dependen de reglas de uso, y una terminología poco clara o inestable puede dificultar la comparación o la replicación de resultados científicos (Maraun & Peters, 2005; Schmalz et al., 2024). La psicología utiliza muchos de estos conceptos — estrés, inteligencia, autoestima, depresión, bienestar e innumerables otros— para organizar observaciones y teorías.
La historia de la medición psicológica refleja un esfuerzo por representar estos atributos cuantitativamente (Michell, 2014). Sin embargo, esto exige cuidado porque los constructos psicológicos normalmente no son directamente observables de la misma manera que la longitud física puede leerse en una regla (Michell, 2001; Trendler, 2013).
Uher (2022) describe un constructo como un sistema conceptual que agrupa referentes considerados significativamente relacionados para una finalidad específica. En este sentido, un constructo no es simplemente un ítem de cuestionario o un comportamiento observado. Siguiendo la tradición de Cronbach & Meehl (1955), los constructos son útiles precisamente porque organizan múltiples referentes observables que no pueden reducirse a una única observación directa.
| Concepto | Qué es | Ejemplo |
|---|---|---|
| Constructo | Un sistema teórico/conceptual utilizado para organizar fenómenos | Depresión |
| Indicador | Una variable observada utilizada para obtener información relevante para el constructo | Respuesta a “Me sentí triste durante la mayor parte del día” |
| Variable latente | Una variable no observada en un modelo estadístico | Un factor común continuo ajustado a ítems de depresión |
Los tres pueden estar relacionados, pero no son intercambiables.
Los constructos son herramientas conceptuales, no objetos físicos (Uher, 2023). Confundir el constructo con el fenómeno que pretende organizar se ha denominado conflación entre constructo y referente (construct–referent conflation) (Maraun & Gabriel, 2013). Un problema relacionado ocurre cuando las variables de un conjunto de datos se discuten como si fueran los propios fenómenos; Uher (2021) describe esto como una forma de conflación entre variable y referente.
Una variable latente es una herramienta estadística —entre varios enfoques posibles— para representar relaciones entre indicadores observados. La tradición del factor común se remonta a Spearman (1904), y los modelos posteriores de variables latentes formalizaron relaciones entre atributos teóricos y sus medidas observadas (Bollen, 1989; Edwards & Bagozzi, 2000). Los indicadores pueden ser ítems de cuestionarios, evaluaciones de entrevistas, observaciones conductuales, medidas de desempeño u otras variables observadas (DeVellis & Thorpe, 2021; Lord & Novick, 1968).
3.5 Formas de Representar un Constructo
La forma en que un constructo se representa estadísticamente debe derivarse de una afirmación sobre por qué los indicadores están relacionados. Es útil distinguir cuatro representaciones amplias.
| Representación | Idea básica | Dirección/estructura | Métodos típicos |
|---|---|---|---|
| Reflexiva/factor común | Una variable latente explica la covariación entre indicadores | Variable latente → indicadores | AFE, AFC, muchos modelos de TRI |
| Compuesta/formativa | Los indicadores definen o forman conjuntamente un compuesto | Indicadores → compuesto | Compuestos ponderados, algunas formulaciones de MEE |
| Red | Los indicadores pueden influirse o interactuar directamente entre sí | Indicador ↔︎ indicador | Modelos de redes psicométricas |
| Clase/perfil latente | Una agrupación categórica no observada explica patrones de respuesta | Clase latente → distribución de las respuestas | ACL, APL, modelos de mezcla |
3.5.1 Modelos reflexivos de factor común
En un modelo de factor común, la covariación entre variables observadas se explica mediante uno o más factores latentes. En su forma más simple, el modelo supone que, después de tener en cuenta el factor común, los indicadores son localmente independientes. Este es un supuesto sustantivo fuerte, y no solo una convención estadística conveniente (Bollen, 1989).
Considere los síntomas de depresión mayor. Un modelo factorial reflexivo puede representar el estado de ánimo deprimido, las alteraciones del sueño, la fatiga, los problemas de concentración y otros síntomas como indicadores de una variable latente común. En esta representación, la variación en el factor latente explica las asociaciones entre los síntomas.
3.5.2 Representaciones de red
Es posible una teoría diferente. Los problemas de sueño pueden contribuir a la fatiga, la fatiga puede contribuir a problemas de concentración y estos síntomas pueden reforzarse mutuamente. En esta explicación, al menos parte de la covariación se produce por relaciones entre los propios indicadores, en lugar de resultar exclusivamente de una causa latente común. Esta es la motivación básica de las representaciones de red de la psicopatología (Borsboom & Cramer, 2013).
La elección entre un modelo factorial y un modelo de red no se resuelve preguntando qué gráfico parece mejor o qué modelo produce índices de ajuste más atractivos. Los modelos hacen afirmaciones diferentes sobre por qué covarían las variables. Estas afirmaciones deben estar motivadas teóricamente y, después, someterse a pruebas empíricas.
3.5.3 Representaciones compuestas y formativas
Una representación compuesta o formativa invierte la lógica reflexiva habitual: los indicadores definen conjuntamente el compuesto. El estatus socioeconómico es un ejemplo común, pues los ingresos, la escolaridad y las características ocupacionales o de vivienda pueden combinarse para definir un índice. Modificar un indicador puede modificar el compuesto, en lugar de interpretarse como efecto de una única causa común subyacente (Edwards & Bagozzi, 2000).
El ACP también puede construir compuestos ponderados, pero el ACP y la medición formativa no deben tratarse como sinónimos. El ACP es un método algebraico para resumir varianza; una interpretación formativa de la medición añade una afirmación sustantiva sobre lo que representa el compuesto.
3.5.4 Clases y perfiles latentes
El análisis de clases latentes (ACL) y el análisis de perfiles latentes (APL) representan la heterogeneidad no observada de forma categórica, y no continua. En lugar de ubicar a las personas a lo largo de un factor continuo, estos modelos describen clases o perfiles no observados que difieren en sus patrones de respuesta (Muthén & Muthén, 2000; Oberski, 2016). Los modelos de mezcla también pueden conectar representaciones categóricas y continuas (Loken & Molenaar, 2008). La distinción entre representaciones numéricas continuas y categóricas se desarrolla más adelante en Capítulo 4.
3.6 Modelos Reflexivos e Interpretación Causal
La medición reflexiva se escribe con frecuencia como si la variable latente produjera variación en sus indicadores. Por ejemplo, si la autoestima se representa reflexivamente, se supone que las diferencias en la variable latente generan diferencias sistemáticas en las respuestas a los ítems. Esta lectura causal es explícita en algunas tradiciones psicométricas e implícita en muchas otras (Bollen, 1989; Bork et al., 2017).
La lógica reflexiva aparece en muchos modelos conocidos, incluido el modelo de factor común, muchos modelos de teoría de respuesta al ítem, modelos de crecimiento latente y otros enfoques de variables latentes (Hambleton et al., 1991; Lord & Novick, 1968; Meredith & Tisak, 1990). Sin embargo, es importante distinguir usar lenguaje causal de establecer una relación causal. La presencia de una flecha en un diagrama de senderos no demuestra causalidad por sí sola (Pearl, 2009).
Algunos autores prefieren una interpretación descriptivista, en la que la variable latente es una representación estadística parsimoniosa, y no una causa común real (Bork et al., 2017; Jonas & Markon, 2016). La diferencia importa porque una interpretación causal de factor común implica más que un modelo de covarianza con buen ajuste: implica que las asociaciones observadas surjan de manera compatible con la estructura causal propuesta.
En un modelo reflexivo simple, se espera que los indicadores se vuelvan independientes después de condicionar en la variable latente común. Si dos ítems continúan influyéndose directamente —por ejemplo, problemas de sueño que causan fatiga—, entonces el supuesto de independencia local puede fallar incluso cuando un modelo unifactorial parezca superficialmente plausible.
3.7 Tétradas Nulas: una Implicación Comprobable
Una manera de examinar las implicaciones de un modelo lineal de causa común es mediante restricciones de tétrada. Los trabajos iniciales de Spearman mostraron que un único factor común impone restricciones a la matriz de covarianza (Spearman, 1904). Estas ideas se desarrollaron posteriormente en el modelado de ecuaciones estructurales y el análisis confirmatorio de tétradas (Bollen, 1989; Bollen & Ting, 1993).
Una tétrada es la diferencia entre dos productos de covarianzas. Para cuatro variables observadas, un ejemplo es
\[ \tau_{1234} = \sigma_{12}\sigma_{34} - \sigma_{13}\sigma_{24}. \]
Una tétrada es nula cuando esta diferencia es cero en la población. En un modelo unifactorial simple con cuatro indicadores y residuos independientes, se implican varias de estas restricciones. Son útiles porque constituyen consecuencias observables del modelo, en lugar de meras afirmaciones sobre un factor no observado.
3.7.1 Treks y restricciones de covarianza
Una forma conveniente de comprender estas restricciones es mediante un grafo dirigido. Un camino dirigido de \(u\) a \(v\) es una secuencia de flechas que apuntan todas hacia \(v\). Un trek es un camino o par de caminos dirigidos que conecta dos variables sin colisión de puntas de flecha. Bajo modelos lineales, las reglas de trek pueden utilizarse para derivar las restricciones de covarianza implicadas por un grafo (Glymour et al., 2014; Glymour & Scheines, 1986).
Cada trek válido contribuye a la covarianza entre dos variables. En un modelo lineal estandarizado, la contribución de un trek se obtiene mediante el producto de los coeficientes a lo largo de ese trek; la covarianza es la suma de las contribuciones de los treks disponibles.
Para el modelo ilustrado, supongamos que las correlaciones estandarizadas implicadas por los caminos son
\[ \begin{aligned} \rho_{uw} &= ab, & \rho_{ux} &= acd, & \rho_{uy} &= ace,\\ \rho_{xy} &= de, & \rho_{wy} &= bce, & \rho_{wx} &= bcd. \end{aligned} \]
Entonces, el modelo implica
\[ \rho_{ux}\rho_{wy}=\rho_{uy}\rho_{wx}. \]
Añadir un camino directo que altere uno de los lados de esta relación puede destruir la igualdad. Por tanto, la tétrada funciona como una implicación comprobable del grafo especificado.
3.7.2 Tétradas en un modelo unifactorial
Considere un modelo unifactorial con cuatro indicadores estandarizados. Si las cargas factoriales son \(\lambda_1,\lambda_2,\lambda_3,\lambda_4\) y los residuos son mutuamente independientes, entonces
\[ \rho_{12}=\lambda_1\lambda_2, \qquad \rho_{34}=\lambda_3\lambda_4, \]
y de manera análoga para los demás pares. En consecuencia,
\[ \rho_{12}\rho_{34} = \rho_{13}\rho_{24} = \rho_{14}\rho_{23}. \]
La idea importante no es que una tétrada nula demuestre que una variable latente causa los indicadores. En cambio, el modelo propuesto implica restricciones sobre covarianzas observables. Si la matriz de covarianza poblacional viola estas restricciones, el modelo simple no puede ser exactamente correcto. Si las restricciones son compatibles con los datos, el modelo sigue siendo plausible bajo los supuestos utilizados para derivarlas (Bollen & Ting, 1993; Glymour et al., 2014).
Las tétradas nulas pueden descartar algunas estructuras de covarianza, pero no establecen de manera única un factor común causal. Diferentes modelos causales pueden, en algunos casos, implicar las mismas restricciones observacionales. Por tanto, las tétradas deben interpretarse como una fuente de evidencia sobre la estructura del modelo, y no como una prueba causal aislada.
Otras restricciones comprobables pueden involucrar covarianzas cero, covarianzas iguales, correlaciones parciales cero, restricciones de igualdad o relaciones polinómicas de orden superior. Las tétradas son especialmente importantes en modelos con múltiples indicadores porque surgen naturalmente de estructuras simples de factor común (Glymour & Scheines, 1986). Franco et al. (2023) discute enfoques relacionados para evaluar las implicaciones causales de modelos factoriales.
3.7.3 Tétradas Nulas en R
El siguiente ejemplo utiliza cuatro ítems de Apertura del conjunto de datos bfi del paquete psych. El objetivo no es demostrar que Apertura sea una variable latente causal. En cambio, preguntamos si estas variables observadas son compatibles con las restricciones de tétrada implicadas por una estructura simple de factor común.
El paquete CauseAndCorrelation contiene una función vanishing.tetrads(). Si el paquete puede instalarse en su entorno de R, el flujo de trabajo es:
Como la disponibilidad de paquetes puede cambiar con el tiempo, la función utilizada en este ejemplo se incluye a continuación para que la lógica del tutorial siga siendo reproducible.
Mostrar la función vanishing.tetrads()
vanishing.tetrads<-function (dat, sig = 0.05)
{
get.3.equations <- function(tet.vector) {
mat <- matrix(NA, ncol = 8, nrow = 3)
mat[1, ] <- cbind(tet.vector[1], tet.vector[2], tet.vector[3],
tet.vector[4], tet.vector[1], tet.vector[4], tet.vector[2],
tet.vector[3])
mat[2, ] <- cbind(tet.vector[1], tet.vector[3], tet.vector[2],
tet.vector[4], tet.vector[1], tet.vector[4], tet.vector[2],
tet.vector[3])
mat[3, ] <- cbind(tet.vector[1], tet.vector[3], tet.vector[2],
tet.vector[4], tet.vector[1], tet.vector[2], tet.vector[3],
tet.vector[4])
mat
}
test.stat <- function(dat, triplet) {
t.vars <- sort(triplet[1:4])
r <- var(dat, na.rm = T)
tao <- r[triplet[1], triplet[2]] * r[triplet[3], triplet[4]] -
r[triplet[5], triplet[6]] * r[triplet[7], triplet[8]]
D13 <- det(r[c(triplet[1], triplet[3]), c(triplet[1],
triplet[3])])
D24 <- det(r[c(triplet[2], triplet[4]), c(triplet[2],
triplet[4])])
D <- det(r[triplet[1:4], triplet[1:4]])
N <- dim(dat)[1]
tao.var <- (D13 * D24 * (N + 1)/(N - 1) - D) * (1/(N -
2))
if (tao.var <= 0) {
cat("triplet: ", triplet, "\n")
cat("variance of tao is ", tao.var, "\n")
cat("tao.var<=0. D=", D, "D13=", D13, "D24=", D24,
"\n")
stop()
}
z <- tao/sqrt(tao.var)
list(triplet = triplet, VCV = r, tao = tao, tao.var = tao.var,
z = z, prob = 2 * (1 - pnorm(abs(z))))
}
get.choke.points <- function(vec) {
tetrad <- matrix(vec, ncol = 2, byrow = T)
all.comb <- cbind(c(vec[1], vec[1], vec[1], vec[2], vec[2],
vec[3]), c(vec[2], vec[3], vec[4], vec[3], vec[4],
vec[4]))
chokes <- rep(T, 6)
for (j in 1:4) {
for (i in 1:6) {
if (sum(tetrad[j, ] == all.comb[i, c(1, 2)]) ==
2)
chokes[i] <- F
if (sum(tetrad[j, ] == all.comb[i, c(2, 1)]) ==
2)
chokes[i] <- F
}
}
list(tetrad = tetrad, all.comb = all.comb, choke.points = all.comb[chokes,
])
}
nvars <- dim(dat)[2]
tetrad.quadriplets <- combn(1:nvars, 4)
ntetrads <- dim(tetrad.quadriplets)[2]
z <- prob <- rep(NA, ntetrads * 3)
count <- 0
for (i in 1:ntetrads) {
triplets <- get.3.equations(tetrad.quadriplets[, i])
for (j in 1:3) {
count <- count + 1
temp <- test.stat(dat, triplets[j, ])
z[count] <- temp$z
prob[count] <- temp$prob
if (prob[count] <= sig)
cat("triplet:", triplets[j, ], " does not vanish (p=",
prob[count], ") \n\n")
if (prob[count] > sig) {
chokes <- get.choke.points(triplets[j, ])
cat("triplet:", triplets[j, ], " vanishes (p=",
prob[count], ") \n")
cat("If there is a saturated dependency graph for the four variables (via EPA):",
triplets[j, 1], triplets[j, 2], triplets[j,
3], triplets[j, 4], "\n")
cat("then there is at least one latent common cause of either (",
chokes$choke.points[1, 1], ",", chokes$choke.points[1,
2], ") and/or of (", chokes$choke.points[2,
1], ",", chokes$choke.points[2, 2], ")\n\n")
}
}
}
}La función evalúa cada conjunto único de cuatro variables y prueba las ecuaciones de tétrada correspondientes. Aquí utilizamos cuatro ítems de Apertura:
O1 O2 O3 O4
Min. :1.000 Min. :1.000 Min. :1.000 Min. :1.000
1st Qu.:4.000 1st Qu.:1.000 1st Qu.:4.000 1st Qu.:4.000
Median :5.000 Median :2.000 Median :5.000 Median :5.000
Mean :4.816 Mean :2.713 Mean :4.438 Mean :4.892
3rd Qu.:6.000 3rd Qu.:4.000 3rd Qu.:5.000 3rd Qu.:6.000
Max. :6.000 Max. :6.000 Max. :6.000 Max. :6.000
NAs :22 NAs :28 NAs :14
Ahora evalúe las tétradas:
triplet: 1 2 3 4 1 4 2 3 vanishes (p= 0.4600686 )
If there is a saturated dependency graph for the four variables (via EPA): 1 2 3 4
then there is at least one latent common cause of either ( 1 , 3 ) and/or of ( 2 , 4 )
triplet: 1 3 2 4 1 4 2 3 does not vanish (p= 0.03361732 )
triplet: 1 3 2 4 1 2 3 4 vanishes (p= 0.1174989 )
If there is a saturated dependency graph for the four variables (via EPA): 1 3 2 4
then there is at least one latent common cause of either ( 1 , 4 ) and/or of ( 3 , 2 )
Si al menos una tétrada implicada es estadísticamente incompatible con cero, la estructura de covarianza observada no es plenamente consistente con todas las restricciones de esta representación factorial simple. La conclusión inversa debe ser más cautelosa: no rechazar una tétrada no demuestra que exista una causa latente común.
3.8 Consideraciones Finales
Las variables latentes son poderosas porque permiten a los investigadores conectar atributos teóricos no observados con patrones en los datos observados. Pero ese poder se deriva de supuestos. Un modelo de factor común, un modelo de red, un compuesto y un modelo de clases latentes pueden todos resumir el mismo conjunto amplio de indicadores mientras hacen afirmaciones muy diferentes sobre por qué esos indicadores están relacionados.
La lección central, por tanto, es mantener conceptualmente distintos los constructos, los indicadores observados y las variables latentes estadísticas. El modelo debe seleccionarse porque sus supuestos son defendibles para el fenómeno y la interpretación pretendida, y no simplemente porque se trate de una rutina psicométrica familiar.
En los capítulos siguientes, el análisis factorial exploratorio y el análisis factorial confirmatorio proporcionarán herramientas prácticas para estudiar la estructura latente. Las cuestiones conceptuales introducidas aquí siguen siendo relevantes a lo largo de todo el libro: ¿Qué representa la variable latente? ¿Por qué deberían covariar los indicadores? ¿Y qué implicaciones observables harían científicamente creíble esta representación?