Accueil Algèbre ACP Méthodes NL ICA ANOVA AFC
Module 2 — ACP · Page 7/7

Interprétation & Exemple complet

Lecture du plan factoriel, cercle des corrélations, facteur taille — et résolution guidée de l'exercice de l'examen passé.

🎯 Cette page résout directement l'exercice 1 de l'examen MTH1620

Les données, questions et démarche suivent exactement le sujet réel. Maîtriser cette page = pouvoir répondre à toutes les questions ACP d'un examen similaire.

1. Comment interpréter un axe factoriel

Méthode

Pour interpréter l'axe \(\alpha\), on regarde les coordonnées des variables \(\varphi_{\alpha j} = \sqrt{\lambda_\alpha} \cdot u_{\alpha j}\) (ou les composantes du vecteur propre \(v_\alpha\) quand les données sont centrées non réduites). Les variables avec les valeurs absolues les plus grandes sont les plus corrélées à l'axe — ce sont elles qui "définissent" l'axe.

Règle de lecture

Variables positives sur l'axe → corrélées positivement entre elles, les individus avec des valeurs fortes sur ces variables se positionnent du côté positif de l'axe.
Variables négatives → corrélées négativement avec les variables positives. L'axe crée une opposition entre deux groupes de variables.

2. Le facteur taille

Qu'est-ce que le facteur taille ?

Quand toutes les variables sont du même côté sur le premier axe (toutes leurs coordonnées ont le même signe), cet axe est appelé "facteur taille". Il oppose les individus "grands" (valeurs élevées partout) aux individus "petits" (valeurs faibles partout). C'est fréquent quand toutes les variables sont positivement corrélées entre elles.

3. Exercice complet — données vin (examen MTH1620)

📄 Énoncé exact de l'examen

6 échantillons de vin décrits par 5 variables quantitatives : pH, Alcool (%), Sucre (g/L), Acidité (g/L), Densité. Les données sont non normalisées.

Données brutes R
VinpHAlcool (%)Sucre (g/L)Acidité (g/L)Densité
Vin A3.212.53.10.600.9962
Vin B2.910.26.50.850.9904
Vin C3.312.12.80.650.9967
Vin D3.010.46.20.900.9911
Vin E3.413.02.00.580.9971
Vin F3.19.02.80.880.9900

Q1 — Quelle méthode ? Dans quel cas ?

✅ Réponse

On utilise l'ACP (Analyse en Composantes Principales). Elle s'applique lorsque :

  • · Le tableau contient des variables quantitatives continues
  • · On souhaite réduire la dimension tout en perdant le minimum d'information
  • · On cherche à visualiser les similitudes entre individus et entre variables
  • · Il existe potentiellement des corrélations entre les variables

Ici : 6 vins × 5 variables quantitatives continues → ACP est la méthode adaptée. Les variables étant d'unités différentes (pH, %, g/L...), on préférera l'ACP normée (données centrées-réduites).

Q2a — Démontrer que les valeurs propres non nulles de R et S sont identiques

✅ Réponse — démonstration complète

Soit \(X\) la matrice des données (\(n \times p\)). On pose \(R = X^TX\) (espace des variables, \(p \times p\)) et \(S = XX^T\) (espace des individus, \(n \times n\)).

Sens 1 : Soit \(u\) un vecteur propre de \(R = X^TX\) pour \(\lambda \neq 0\) : \(X^TX \, u = \lambda u\).

Pré-multiplions par \(X\) : \(XX^T(Xu) = \lambda(Xu)\).

Donc \(v = Xu\) est vecteur propre de \(S = XX^T\) pour la même valeur propre \(\lambda\). ✓

Sens 2 : Par symétrie (pré-multiplier par \(X^T\) une relation propre de \(S\)), toute valeur propre non nulle de \(S\) est aussi valeur propre de \(R\).

Conclusion : les valeurs propres non nulles de \(R\) et \(S\) sont identiques. ∎

Q2b — Relation entre uk et vk

✅ Réponse

De la démonstration : \(v_k = Xu_k\) est vecteur propre de \(S\) pour \(\lambda_k\). Sa norme vaut \(\|Xu_k\|^2 = u_k^T X^T X u_k = \lambda_k\).

Pour obtenir un vecteur propre unitaire :

\[\boxed{v_k = \frac{1}{\sqrt{\lambda_k}} X u_k \qquad \text{et} \qquad u_k = \frac{1}{\sqrt{\lambda_k}} X^T v_k}\]

Q3 — Signification géométrique de la dualité

✅ Réponse

Dans \(\mathbb{R}^p\) (espace des variables) : chaque individu est un point. On cherche le sous-espace qui maximise la dispersion du nuage des \(n\) individus autour du centre de gravité. Les composantes principales \(\psi_\alpha = Xu_\alpha\) sont les coordonnées des individus sur les axes factoriels.

Dans \(\mathbb{R}^n\) (espace des individus) : chaque variable est un point sur la sphère unité. L'axe factoriel \(v_\alpha\) ajuste le nuage des \(p\) variables. La coordonnée d'une variable sur l'axe = sa corrélation avec la composante principale.

La dualité : les deux analyses sont reliées par \(v_\alpha = \frac{1}{\sqrt{\lambda_\alpha}}Xu_\alpha\). On obtient les résultats dans les deux espaces en ne diagonalisant qu'une seule matrice (la plus petite).

Q4 — Calculer R et S

✅ Démarche — centrage des données

On centre d'abord les données. Les moyennes des 5 variables :

VariablepHAlcoolSucreAciditéDensité
Moyenne r̄ⱼ3.15011.2003.9000.7430.9936
Données centrées X = R − r̄
VinpHAlcoolSucreAciditéDensité
Vin A0.051.30−0.80−0.1430.0026
Vin B−0.25−1.002.600.107−0.0032
Vin C0.150.90−1.10−0.0930.0031
Vin D−0.15−0.802.300.157−0.0025
Vin E0.251.80−1.90−0.1630.0035
Vin F−0.05−2.20−1.100.137−0.0036
✅ S = XX' (6×6) — matrice de covariance espace individus

Le terme \(S_{ii'} = \sum_{j=1}^5 x_{ij} x_{i'j}\) (produit scalaire des profils centrés des individus \(i\) et \(i'\)).

Exemple : \(S_{AA} = (0.05)^2 + (1.30)^2 + (-0.80)^2 + (-0.143)^2 + (0.0026)^2 \approx 0.0025 + 1.69 + 0.64 + 0.0204 + 0 \approx 2.353\)

Note : en examen, le prof donne souvent les valeurs propres et vecteurs propres déjà calculés (comme ici λ₁=4.774, λ₂=1.468). Le calcul complet de S n'est pas toujours requis.

✅ R = X'X (5×5) — matrice de covariance espace variables

Le terme \(R_{jj'} = \sum_{i=1}^6 x_{ij} x_{ij'}\) (produit scalaire des vecteurs-variables centrés).

Exemple : \(R_{Alcool,Sucre} = (1.30)(−0.80)+(−1.00)(2.60)+(0.90)(−1.10)+(−0.80)(2.30)+(1.80)(−1.90)+(−2.20)(−1.10)\)

\(= −1.04−2.60−0.99−1.84−3.42+2.42 = −7.47\)

Alcool et Sucre sont fortement anticorrélés (covariance négative importante).

Q5a — Interpréter les deux premiers axes factoriels

✅ Données : λ₁ = 4.774, v₁ = (−0.083, −0.547, 0.831, 0.061, −0.001)

Les composantes du vecteur propre \(v_1\) donnent les coordonnées (non normalisées) des variables sur l'axe 1. Pour interpréter, on regarde les valeurs absolues les plus grandes :

▶ Coordonnées des variables sur les axes (|vαj| = poids sur l'axe)

AXE 1 — λ₁ = 4.774 (taux d'inertie : 4.774/p)

AXE 2 — λ₂ = 1.468

✅ Interprétation — Axe 1

Variables dominantes : Sucre (+0.831) et Alcool (−0.547) ont les plus grandes valeurs absolues.

L'axe 1 oppose les vins riches en sucre résiduel (côté positif : Vin B, Vin D) aux vins riches en alcool (côté négatif : Vin E, Vin A, Vin C).

Axe 1 = opposition sucre/alcool — traduit probablement le degré de fermentation (plus de sucre = moins d'alcool).

✅ Interprétation — Axe 2 : v₂ = (−0.007, −0.832, −0.552, 0.049, −0.001)

Variables dominantes : Alcool (−0.832) et Sucre (−0.552), mêmes signes — pas d'opposition.

L'axe 2 oppose les vins avec beaucoup d'alcool ET beaucoup de sucre aux vins avec peu des deux. C'est potentiellement un facteur "intensité" ou "richesse".

Q5b — Représentation des individus sur le plan factoriel

✅ Calcul des coordonnées ψ = Xv pour chaque vin

La coordonnée de l'individu \(i\) sur l'axe \(\alpha\) est \(\psi_{\alpha i} = \sum_j x_{ij} \cdot v_{\alpha j}\).

Vin B sur axe 1 : \(\psi_{1,B} = (−0.25)(−0.083)+(−1.00)(−0.547)+(2.60)(0.831)+(0.107)(0.061)+(−0.0032)(−0.001)\)

\(\approx 0.021 + 0.547 + 2.161 + 0.007 + 0 \approx +2.73\) → Vin B est fortement positif sur l'axe 1 (riche en sucre ✓)

Vin E sur axe 1 : \(\psi_{1,E} = (0.25)(−0.083)+(1.80)(−0.547)+(−1.90)(0.831)+\cdots \approx −0.021−0.985−1.579+\cdots \approx −2.72\) → Vin E est fortement négatif (riche en alcool ✓)

▶ Plan factoriel (F1, F2) — 6 vins

Axe 1 : oppose vins sucrés (+) aux vins alcoolisés (−)   Axe 2 : intensité globale

✅ Interprétation du plan factoriel

Vins B et D (côté positif axe 1) : riches en sucre résiduel, moins alcoolisés.

Vins A, C, E (côté négatif axe 1) : peu de sucre, bien alcoolisés. Vin E est le plus extrême.

Vin F : peu d'alcool ET peu de sucre → côté négatif sur l'axe 2.

→ Le plan factoriel révèle deux groupes : vins doux (B, D) vs vins secs et alcoolisés (A, C, E).

4. Cercle des corrélations — lecture

Règles de lecture

Dans le cercle des corrélations (\(\mathbb{R}^n\)), chaque variable est une flèche. La longueur de la flèche indique la qualité de représentation (proche du bord = bien représentée). L'angle entre deux flèches donne leur corrélation (\(\cos\theta = r\)).

Variables bien représentées

Flèche proche du bord du cercle (cos² ≈ 1). On peut interpréter leur position et leurs angles.

Variables mal représentées

Flèche courte, proche du centre. Ne pas interpréter leur position — elles ont leur variance sur d'autres axes.

📌 À retenir — Interpréter une ACP à l'examen

  • Axe 1 : regarder les variables avec les plus grandes valeurs absolues dans \(v_1\) — elles définissent l'axe
  • Signes opposés → opposition entre deux groupes de variables
  • Mêmes signes → facteur commun (intensité, taille...)
  • Individus : calculer \(\psi_{\alpha i} = \sum_j x_{ij} v_{\alpha j}\) pour positionner dans le plan
  • Taux d'inertie de l'axe α (espace variables, non normé) : \(\lambda_\alpha / \text{tr}(R)\)
  • Deux individus proches dans le plan factoriel → profils similaires pour toutes les variables
  • Variable proche du bord du cercle = bien représentée sur ce plan = on peut interpréter
🧠 Quiz — questions types examen
Un vecteur propre \(v_1\) a les composantes \((0.8, -0.6, 0.1)\) pour les variables (Alcool, Sucre, pH). Comment interpréter l'axe 1 ?
Sur le plan factoriel, deux vins sont très proches. Que peut-on conclure ?
Pour les données vin, λ₁ = 4.774. Avec 5 variables, quel est le taux d'inertie de l'axe 1 ? (tr(R) ≈ 7.53)