Pour une utilisation optimale, veuillez visiter numiqo sur votre PC de bureau !

Calculate
Dependent Variable
Independent Variable

Comment faire

Calculateur Random Forest

Données d'exemple pour une classification Random Forest Données d'exemple pour une régression Random Forest

Le calculateur Random Forest crée un modèle prédictif à partir d'une variable dépendante et de deux variables prédictives ou plus. Si la variable dépendante est catégorielle, numiqo effectue une classification Random Forest. Si la variable dépendante est métrique, numiqo effectue une régression Random Forest.

Pour calculer une Random Forest en ligne, ouvrez l'analyse prédictive, sélectionnez Random Forest, choisissez la variable dépendante, puis sélectionnez les variables indépendantes à utiliser comme prédicteurs.

Qu'est-ce qu'une Random Forest ?

Une Random Forest est une méthode d'ensemble. Au lieu d'utiliser un seul arbre de décision, elle construit de nombreux arbres de décision et combine leurs prédictions. Chaque arbre est entraîné sur un échantillon bootstrap des données, et à chaque division seul un sous-ensemble aléatoire de prédicteurs est pris en compte. Cela rend le modèle moins dépendant d'un arbre instable et améliore généralement la performance prédictive.

Pour la classification, chaque arbre vote pour une catégorie de la variable dépendante et la forêt prédit la catégorie qui obtient le plus de votes. Pour la régression, chaque arbre prédit une valeur numérique et la forêt utilise la prédiction moyenne de l'ensemble des arbres.

Fonctionnement du calculateur Random Forest

Le calculateur suit une approche de type CART. Pour chaque échantillon bootstrap, il construit un arbre binaire. Les divisions de classification sont évaluées avec l'impureté de Gini. Les divisions de régression sont évaluées avec l'erreur quadratique. Le modèle final combine tous les arbres par vote majoritaire pour la classification ou par moyenne des prédictions pour la régression.

  1. Échantillons bootstrap : chaque arbre est entraîné sur un échantillon aléatoire tiré avec remise à partir des lignes d'origine.
  2. Sélection aléatoire des prédicteurs : à chaque noeud, seul un sous-ensemble de prédicteurs est pris en compte pour la division. Par défaut, le calculateur utilise la racine carrée du nombre de prédicteurs sélectionnés.
  3. Divisions binaires : les prédicteurs catégoriels sont divisés en séparant une catégorie des catégories restantes. Les prédicteurs métriques sont divisés avec des règles de seuil.
  4. Prédiction combinée : la classification utilise le vote majoritaire. La régression calcule la moyenne des prédictions numériques des arbres.
  5. Validation out-of-bag : les lignes non utilisées dans l'échantillon bootstrap d'un arbre sont prédites par cet arbre. Ces prédictions out-of-bag estiment la performance du modèle sans nécessiter de jeu de test séparé.

Résultats de la Random Forest

Les résultats de la Random Forest comprennent un tableau de méthode, la performance out-of-bag et l'importance relative des variables. Les modèles de classification incluent également une matrice de confusion. Les modèles de régression indiquent le RMSE, le MAE et le R carré.

Exactitude out-of-bag

L'exactitude out-of-bag est le pourcentage de lignes correctement classées en utilisant uniquement les arbres pour lesquels cette ligne n'était pas incluse dans l'échantillon bootstrap. Il s'agit d'une mesure pratique de validation interne, couramment utilisée avec les modèles Random Forest.

Performance de régression

Pour la régression Random Forest, le tableau out-of-bag indique le RMSE, le MAE et le R carré. Le RMSE et le MAE décrivent l'erreur de prédiction typique dans les unités de la variable dépendante. Le R carré décrit la part de la variance out-of-bag expliquée par les prédictions.

Matrice de confusion

La matrice de confusion compare la catégorie observée avec la catégorie prédite. Les lignes indiquent les catégories réelles et les colonnes indiquent les catégories prédites. Le pourcentage correct de chaque ligne indique la fréquence à laquelle les observations de cette catégorie réelle ont été correctement classées.

Importance des variables

L'importance des variables résume dans quelle mesure chaque prédicteur améliore les divisions des arbres dans la forêt. Une importance relative plus élevée signifie que la variable a davantage contribué à améliorer les divisions dans la forêt. L'importance est utile pour classer les prédicteurs, mais elle ne doit pas être interprétée comme une preuve de causalité.

Random Forest ou arbre de décision

Un seul arbre de décision CHAID est plus facile à interpréter, car l'arbre complet peut être inspecté. Une Random Forest est généralement plus performante pour la prédiction, car elle fait la moyenne de nombreux arbres, mais elle résume le modèle à l'aide de métriques de performance et de l'importance des variables plutôt qu'avec un simple diagramme d'arbre.

Quand utiliser Random Forest

Utilisez la classification Random Forest lorsque la variable dépendante est catégorielle et que l'objectif est de prédire l'appartenance à un groupe. Utilisez la régression Random Forest lorsque la variable dépendante est métrique et que l'objectif est de prédire une valeur numérique. Les applications courantes comprennent la prédiction de l'attrition des clients, la classification des risques, le contrôle qualité, la prévision de la demande et la segmentation des clients.

Limites

Les lignes contenant des valeurs manquantes dans les variables sélectionnées sont exclues du calcul. L'implémentation actuelle utilise des divisions binaires de type CART et une validation interne out-of-bag. Elle n'inclut pas encore la prédiction pour de nouvelles lignes, les graphiques de dépendance partielle ni les options avancées de pénalité pour valeurs manquantes.

Cité numiqo: numiqo Team (2026). numiqo: Online Statistics Calculator. numiqo e.U. Graz, Austria. URL https://numiqo.com