Grupo de investigación Beta Chiclayo

Grupo de investigación Beta Chiclayo Asesoramiento Académico de calidad, enfoque de investigación, observaciones y preparación para sustentación, además de análisis estadístico eficiente.

📈Análisis de componentes principales📈El Análisis de Componentes Principales (PCA) es una poderosa técnica de reducción d...
19/05/2026

📈Análisis de componentes principales📈
El Análisis de Componentes Principales (PCA) es una poderosa técnica de reducción de dimensionalidad utilizada para simplificar conjuntos de datos complejos transformando muchas variables correlacionadas en un número menor de variables no correlacionadas llamadas componentes principales. El PCA se utiliza ampliamente en agricultura, genómica, bioinformática, análisis de imágenes y aprendizaje automático.
📌 ¿Qué es PCA?
PCA convierte un conjunto de datos con muchas variables en un nuevo sistema de coordenadas donde:
PC1 (componente principal 1) explica la mayor cantidad de variación.
PC2 explica la segunda mayor cantidad de variación.
PC3 explica la siguiente variación más grande.
Y así sucesivamente.
Estos componentes son combinaciones lineales de las variables originales.
📌 Por qué es importante el PCA
PCA es útil para:
Reducción de dimensionalidad
Eliminar redundancia entre variables correlacionadas
Visualización de datos de alta dimensión
Detectando valores atípicos
Identificando relaciones variables
Preprocesamiento de datos antes del aprendizaje automático
📌 Aplicaciones de PCA
Agricultura
Análisis de la propiedad del suelo
Perfil de nutrientes
Fenotipado vegetal
Análisis de datos espectrales
Genómica y Bioinformática
Análisis de expresión genética
Genética de la población
Análisis SNP
Procesamiento de imágenes
Extracción de característica
Compresión
Finanzas
Análisis de la bolsa
Ciencia ambiental
Clima y estudios sobre la contaminación
📌 Conjunto de datos de ejemplo
Supongamos que tienes medidas de la planta:
Altura de la planta Área de la hoja de clorofila Longitud de la raíz
1 35 120 42 15
2 40 135 46 18
3 38 128 44 17
4 45 150 49 21
📌 Instalar paquetes obligatorios
Pip instala pandas numpy matplotlib scikit-learn
📌 Código Python para PCA
importar pandas como pd
importar matplotlib.pyplot como plt
de sklearn.preprocesando importación StandardScaler
de sklearn.decomposition importación PCA
# Cargar conjunto de datos
df = pd.read_csv("plant_data.csv")
# Opcional: etiquetas de tratamiento separadas si están presentes
# etiquetas = df['tratamiento']
# X = df.drop('tratamiento', eje=1)
X = df # si todas las columnas son numéricas
# Estandarizar los datos
escalador = escalador estándar()
X_scaled = scaler.fit_transform(X)
# Realizar PCA
pca = PCA()
X_pca = pca.fit_transform(X_scaled)
# Relación de varianza explicada
Varianza_explicada = pca.explained_variance_ratio_
print ("Proporción de varianza explicada:")
impresión (varianza_explicada)
# Crear marcos de datos de puntuaciones
Puntuaciones = pd.DataFrame(
X_pca,
columns=[f"PC{i+1}" for i in range(X_pca.shape[1])]
)
impresión (puntuaciones.head())
📌 Scree Trama
plt.figure (size=(8, 5))
por favor.trama(
rango(1, len(explained_variance) + 1),
explicado_variance,
marcador='o'
)
plt.xlabel ("Componente principal")
plt.ylabel ("Proporción de varianza explicada")
Plt.title ("Plot Scree")
por favor.show()
📌 Trama de puntuación de PCA
plt.figura (size=(8, 6))
plt.scatter(puntuaciones['PC1'], puntuaciones ['PC2'])
para i en rango (len (puntuaciones)):
plt.text(scores['PC1'][i], scores['PC2'][i], str(i+1))
plt.xlabel("PC1")
plt.ylabel("PC2")
plt.title ("PCA Score Plot")
plt.grid (Verdadero)
por favor.show()
📌 PCA con grupos de tratamiento
etiquetas = df['tratamiento']
X = df.drop ('tratamiento', eje=1)
X_scaled = StandardScaler().fit_transform(X)
pca = PCA(n_componentes=2)
X_pca = pca.fit_transform(X_scaled)
puntuaciones = pd.DataFrame(X_pca, columns=['PC1', 'PC2'])
puntuaciones ['tratamiento'] = etiquetas
para tratamiento en puntuaciones ['tratamiento']. único():
subconjunto = puntuaciones[puntuaciones['tratamiento'] == tratamiento]
plt.scatter(subset['PC1'], subconjunto['PC2'], etiqueta=tratamiento)
plt.xlabel("PC1")
plt.ylabel("PC2")
plt.leyenda()
plt.title ("PCA por tratamiento")
por favor.show()
📌 Cargas (Aportes variables)
cargas = pd.DataFrame(
pca.components_. T,
columnas=['PC1', 'PC2'],
índice=X.columnas
)
Imprimir (cargas)
Interpretación:
Grandes valores positivos o negativos indican una fuerte influencia.
Las variables con direcciones similares están positivamente correlacionadas.
Las direcciones opuestas indican correlación negativa.
📌 Biplota
plt.figure (size=(8, 8))
plt.scatter(puntuaciones['PC1'], puntuaciones ['PC2'])
para i, estaba en el enumerado (X.columnas):
plt.flecha(
0, 0,
loadings.iloc[i, 0] * 3,
loadings.iloc[i, 1] * 3,
ancho_cabeza=0,05
)
por favor.texto(
cargas.iloc[i, 0] * 3.2,
cargas.iloc[i, 1] * 3.2,
var
)
plt.xlabel("PC1")
plt.ylabel("PC2")
PLT.TItle ("PCA Biplot")
plt.grid (Verdadero)
por favor.show()
📌 Seleccionando el número de componentes
Una regla común es retener suficientes componentes para explicar el 80-95 % de la varianza total.
importar entusiasmado como np
varianza_ acumulativa = np.cumsum(varianza_explicada)
impresión (varianza_acumulativa)
📌 Ejemplo de interpretación
Supongamos:
PC1 explica 65%
PC2 explica el 20%
Total = 85%
Esto significa que los dos primeros componentes resumen la mayor parte de la información del conjunto de datos.
📌 PCA en Agricultura y Bioinformática
Para su investigación, PCA puede ser usado para analizar:
Concentraciones nutritivas del suelo (N,P,K)
Respuestas de humedad y fertigación
Firmas espectrales
Perfiles de expresión genética
Rasgos fenotipados vegetales
Medidas de la arquitectura de la raíz
📌 Ventajas de PCA
Reduce la complejidad
Quita multicolinealidad
Mejora la visualización
Acelera los algoritmos de aprendizaje automático
📌 Limitaciones de PCA
Asume relaciones lineales
Los componentes pueden ser más difíciles de interpretar biológicamente
Sensible a la escalada
Puede ser afectado por atípicos

10/05/2026

¡Un muy feliz día a todas las madres!

En la regresión logística binaria, el R² tradicional de regresión lineal no se aplica directamente porque la variable de...
09/05/2026

En la regresión logística binaria, el R² tradicional de regresión lineal no se aplica directamente porque la variable dependiente es dicotómica (0/1), no continua.

➡️ En su lugar, se utilizan medidas de Pseudo R² (como Cox y Snell, Nagelkerke o McFadden) para estimar la proporción de varianza explicada, las cuales evalúan la mejora del modelo respecto a uno nulo basado en la verosimilitud. 📊

🔹 Logaritmo de Verosimilitud
Mide qué tan probable es observar los datos actuales dado el modelo. Se usa para comparar modelos.

📉 Una reducción significativa de -2LL entre el modelo nulo y el ajustado sugiere que el modelo es útil.

🔹 R² de Cox y Snell
Es un coeficiente que estima la proporción de varianza explicada, basado en la mejora de la verosimilitud del modelo ajustado frente al nulo.

⚠️ Su valor máximo teórico es menor a 1, incluso para modelos perfectos, lo que dificulta su interpretación directa.

En SPSS puedes hacer una regresión ordinal de dos maneras La forma 1. Desde Analizar < Regresión < Ordinal. Lo important...
09/05/2026

En SPSS puedes hacer una regresión ordinal de dos maneras

La forma 1. Desde Analizar < Regresión < Ordinal. Lo importante de esta forma es que puedes activar la prueba de líneas paralelas que es el supuesto mas importante para esta estadístico. Lo malo es que no te ofrece los Odds Ratio.

La forma 2. Lo puedes hacer desde analizar < Modelos lineales Generalizados. Esta forma si te da los Odds Ratio pero no te hace el supuesto de las líneas paralelas.

Ambas formas son complementarias.

30/04/2026
𝐄𝐥 𝐀𝐧𝐚́𝐥𝐢𝐬𝐢𝐬 𝐅𝐚𝐜𝐭𝐨𝐫𝐢𝐚𝐥 𝐂𝐨𝐧𝐟𝐢𝐫𝐦𝐚𝐭𝐨𝐫𝐢𝐨 (𝐀𝐅𝐂) 𝐬𝐢𝐫𝐯𝐞 𝐩𝐚𝐫𝐚:⬛ Confirmar una estructura teórica previa. Ya no exploras como en ...
07/04/2026

𝐄𝐥 𝐀𝐧𝐚́𝐥𝐢𝐬𝐢𝐬 𝐅𝐚𝐜𝐭𝐨𝐫𝐢𝐚𝐥 𝐂𝐨𝐧𝐟𝐢𝐫𝐦𝐚𝐭𝐨𝐫𝐢𝐨 (𝐀𝐅𝐂) 𝐬𝐢𝐫𝐯𝐞 𝐩𝐚𝐫𝐚:
⬛ Confirmar una estructura teórica previa. Ya no exploras como en AFE, aquí pruebas si tu modelo teórico se ajusta a los datos.
⬛ Evaluar la validez del constructo. Te permite ver si los ítems realmente miden lo que dices (validez convergente y discriminante).
⬛ Comparar modelos. Puedes probar si un modelo es mejor que otro (por ejemplo, 1 factor vs 2 factores).
𝐂𝐨𝐧𝐬𝐞𝐣𝐨𝐬 𝐜𝐥𝐚𝐯𝐞 𝐢𝐦𝐩𝐨𝐫𝐭𝐚𝐧𝐭𝐞𝐬:
1️⃣ No hagas AFC sin AFE previo (en muchos casos)
2️⃣ Primero exploras (AFE), luego confirmas (AFC). Saltarte esto es un error clásico.
3️⃣ El ajuste global no lo es todo. 👉 No te obsesiones solo con índices como CFI, TLI, RMSEA. También revisa cargas factoriales y sentido teórico
4️⃣ Cuidado con modificar el modelo solo para que “ajuste”. 👉 Agregar correlaciones de errores sin justificación teórica = mala práctica 🚫
5️⃣ El tamaño de muestra importa mucho. AFC es exigente: muestras pequeñas → resultados inestables.
Si lo reduces a una idea clave:
📌 𝐄𝐥 𝐀𝐅𝐄 𝐝𝐞𝐬𝐜𝐮𝐛𝐫𝐞 𝐥𝐚 𝐞𝐬𝐭𝐫𝐮𝐜𝐭𝐮𝐫𝐚, 𝐞𝐥 𝐀𝐅𝐂 𝐥𝐚 𝐩𝐨𝐧𝐞 𝐚 𝐩𝐫𝐮𝐞𝐛𝐚.

Dirección

Chiclayo
14001

Horario de Apertura

Lunes 08:00 - 18:00
Martes 08:00 - 18:00
Miércoles 08:00 - 18:00
Jueves 08:00 - 18:00
Viernes 08:00 - 18:00
Sábado 08:00 - 13:00

Teléfono

+51935049499

Notificaciones

Sé el primero en enterarse y déjanos enviarle un correo electrónico cuando Grupo de investigación Beta Chiclayo publique noticias y promociones. Su dirección de correo electrónico no se utilizará para ningún otro fin, y puede darse de baja en cualquier momento.

Atajos

Compartir