Aller au contenu principal
← Retour au blog

Comment notre juge de backtest s'est pris en défaut, et ce qu'on a corrigé

📅 2026-10-11
✍️ Strategy Arena
backtest tradingview walk-forward test SPA faux positifs statistiques recherche

Un juge de stratégies n'a de valeur que si l'on peut vérifier ses verdicts, y compris contre lui-même. Le 11 octobre 2026, en relisant nos propres rapports, nous avons trouvé une phrase fausse dans le juge de la Lab : le test SPA disait qu'une stratégie « bat l'achat-conservation de façon significative » alors qu'elle faisait moins bien que l'achat-conservation. Voici le défaut, sa cause, la correction et les mesures qui la vérifient.

Ceci est de la recherche sur données publiques passées. Rien ici n'est un conseil d'investissement.

Ce qui s'est passé

Le même jour, la Lab jugeait cinq stratégies de tendance classiques en walk-forward sur 2019-2025 (résultats complets : cinq stratégies de tendance célèbres jugées sur plusieurs cycles crypto). Quatre d'entre elles finissaient nettement sous l'achat-conservation : leur écart moyen par barre était négatif, avec une statistique t entre −2,16 et −2,58.

Pourtant, chacun de ces quatre rapports affichait :

SPA p = 0,02 : le réglage figé sur l'entraînement bat l'achat-conservation de façon significative.

Les p affichés allaient de 0,5 % à 2 % (2 %, 1,1 %, 0,5 % et 0,82 %). Une stratégie sous la référence ne peut pas la battre « de façon significative ». La phrase était fausse.

Le test SPA, en deux phrases

Le test SPA (Superior Predictive Ability, Hansen 2005) répond à une question : la meilleure des stratégies testées bat-elle vraiment la référence, ou est-ce le genre d'écart que le hasard produit quand on essaie plusieurs règles ? Il compare la statistique observée à des milliers de rééchantillonnages des données (bootstrap) ; le p est la part des rééchantillonnages qui font au moins aussi bien que l'observé.

La cause

Le test de Hansen tronque la statistique observée à zéro : T = max(0, t). Si la stratégie est sous la référence, t est négatif et T vaut 0. Les statistiques rééchantillonnées T* sont elles aussi tronquées, donc toujours supérieures ou égales à 0. Par définition, la part des T* supérieurs ou égaux à 0 vaut 1 : le p doit être de 100 %.

Notre estimateur comptait les T* strictement supérieurs à T, au lieu de supérieurs ou égaux. Avec T = 0, il ne comptait plus que les rares tirages où la stratégie passait devant la référence, d'où un p minuscule et une phrase « significative ». Un signe > à la place de ≥.

Le défaut touchait tous les tests SPA à un seul candidat de la Lab : coupure unique, preuve poolée sur plusieurs marchés, règle fixée, portefeuille et walk-forward. Il touchait aussi le SPA d'entraînement multi-variantes quand toutes les variantes sont sous la référence.

Ce qui a été corrigé

  • L'estimateur compte maintenant T* ≥ T, comme dans la définition de Hansen. Une statistique tronquée à zéro donne p = 100 %. Quand la statistique observée est positive, compter « ≥ » ou « > » revient au même : la capacité du test à détecter une vraie stratégie ne change pas.
  • Lecture défensive des anciens rapports : partout où un verdict ou une phrase lit ce p, la Lab vérifie la statistique observée. Si elle est nulle ou négative, le p lu vaut 100 %, même dans un rapport écrit par une version précédente. Un ancien rapport ne peut plus afficher « significatif » sous la référence.
  • Les anciens reçus restent vérifiables : chaque reçu se revérifie avec l'estimateur qu'il déclare. Corriger n'efface pas l'historique.
  • Le risque face à l'achat-conservation est maintenant donné pli par pli en walk-forward (baisse maximale, Calmar, Ulcer, part des hausses et des baisses captées, temps en position).

La correction est dans la version 245 de la Lab, en cours de livraison. Si vous utilisez une version antérieure : une phrase SPA « significative » sur une stratégie qui fait moins que l'achat-conservation est à ignorer.

Les mesures, avant et après

Une correction se mesure. Nous avons rejoué les mêmes calculs, au bit près, avant et après.

Contrôle Avant Après
Série synthétique « stratégie sous l'achat-conservation » (t de −11,8 à −54,2) p = 0 % p = 100 %
Les 4 rapports walk-forward du 11 octobre (même chaîne, même t) p = 2 % ; 1,1 % ; 0,5 % ; 0,82 % p = 100 % pour les quatre, phrase « compatible avec du hasard »
Bruit pur, 3 scénarios × 100 répétitions : SPA ≤ 10 % alors que la stratégie est sous la référence (coupure unique) 3 ; 9 ; 82 0 ; 0 ; 0
Même chose en walk-forward 8 ; 100 ; 88 0 ; 0 ; 0
Bruit pur : verdict « résiste » 0 partout 0 partout (inchangé)
Puissance : stratégies avec un vrai avantage injecté, verdict « résiste » (coupure / walk-forward) 6 / 8 et 54 / 81 sur 100 identique : 6 / 8 et 54 / 81

Lecture : sur du bruit pur, l'ancien calcul affichait un SPA « significatif » sous la référence jusqu'à 82 et 88 fois sur 100 dans un des scénarios. Après correction : zéro. Et la Lab détecte toujours aussi souvent les stratégies qui ont un vrai avantage.

Pourquoi aucun faux verdict n'est sorti

Le verdict final de la Lab ne repose jamais sur un seul test. Pour dire « résiste », il faut aussi une chaîne hors échantillon au-dessus de l'achat-conservation, une majorité de plis gagnés, un DSR suffisant et au moins 30 événements indépendants. Ces conditions bloquaient déjà : les quatre stratégies sont restées « non concluantes », avant comme après.

Le chemin vers un faux « résiste » existait pourtant. Une stratégie défensive peut finir au-dessus de l'achat-conservation en rendement composé, parce qu'elle évite les grosses baisses, tout en ayant un écart moyen arithmétique négatif par barre. Dans ce cas, le SPA fautif pouvait apporter la pièce manquante. Ce chemin est fermé.

Reste un point ouvert, assumé : un second test SPA, à blocs fixes, a la même forme. Il ne sert qu'à des diagnostics d'entraînement scellés, jamais à un verdict. Le modifier changerait des preuves déjà scellées ; la décision n'est pas encore prise.

Ce que ça change si vous backtestez sur TradingView

Le Strategy Tester de TradingView calcule une stratégie sur l'historique affiché. Il donne un profit, un drawdown, un taux de réussite, mais pas de période de test mise à l'écart ni de test de significativité. Quand vous lisez une statistique de « significativité » ailleurs, y compris chez nous, quatre réflexes :

  1. Vérifiez le signe avant le p. Un p ne dit pas dans quel sens va l'écart. Si la stratégie fait moins que l'achat-conservation, aucun p ne la rend meilleure.
  2. Composé et moyenne ne disent pas la même chose. Une règle qui évite les krachs peut finir au-dessus en capital tout en perdant en moyenne barre par barre. Regardez les deux.
  3. Demandez la période jamais vue. Un résultat calculé sur tout l'historique, après réglages, mesure surtout la qualité de l'ajustement au passé.
  4. Exigez qu'un juge soit testé sur du bruit. Un juge sérieux publie combien de fois il déclare « significatif » une stratégie sans avantage, et combien de fois il détecte une vraie. C'est ce tableau qui permet de lui faire confiance, ou non.

Pour faire juger votre propre script Pine sur une période qu'il n'a jamais vue, la Lab est gratuite et calcule le verdict sur votre PC. Le Quick Check donne un premier avis sans installation.

À retenir

  • Le juge de la Lab affichait à tort un SPA « significatif » (p de 0,5 à 2 %) pour des stratégies sous l'achat-conservation : un > à la place d'un ≥.
  • Corrigé à la cause : p = 100 % quand la statistique observée est nulle, y compris à la relecture des anciens rapports.
  • Mesuré : faux « significatifs » sur bruit de 82 et 88 sur 100 à 0, puissance inchangée, aucun verdict modifié.
  • Un juge incorruptible n'est pas un juge qui ne se trompe jamais : c'est un juge dont les erreurs se voient, se mesurent et se corrigent en public.

Pour aller plus loin : le Monte Carlo pour séparer l'avantage de la chance et notre méthodologie.

Recherche sur données publiques passées et simulées. Aucun contenu de cette page n'est un conseil d'investissement.

⚠️ Avertissement — Cet article est publié à titre informatif et éducatif uniquement. Il ne constitue en aucun cas un conseil en investissement ou une recommandation d'achat/vente. Les performances passées ne préjugent pas des performances futures. Strategy Arena est un simulateur éducatif avec capital virtuel. Faites vos propres recherches avant toute décision d'investissement.

Cet article vous a plu ? Partagez-le

𝕏 Partager sur X ✈️ Telegram

Transformez un resultat local en preuve durable

Le Lab tourne gratuitement sur votre PC. Les options payantes conservent ou etendent le travail — elles ne changent jamais le verdict.

Obtenir le Lab (gratuit) Builder / Operator Publier un rapport Lab Hall des Lab Reports
TradingView Starter
Choisissez votre parcours de compte. Vérifiez votre stratégie séparément.
Votre premier graphique et votre première alerte de prix ne nécessitent pas le Lab. Une preuve Strategy Arena reste nécessaire avant de faire confiance à une stratégie ou de l'exporter.
L'attribution partenaire concerne les nouveaux utilisateurs et les achats web éligibles. Strategy Arena peut recevoir une commission ; commencer avec un compte gratuit ne demande aucun paiement.
Je n’ai jamais eu de compte · Commencer gratuitement J’ai déjà un compte Vérifier une stratégie
Autres parcours TradingView
Revue Pine sous contrôle de preuve