Chiffres calculés sur le journal d’appels de chaque essai. La durée va du premier au dernier appel enregistré et dépend aussi de la vitesse du service de chaque modèle. Les « vérifications annoncées » sont ce que la soumission dit avoir fait ; seul le test à l’aveugle est contrôlé dans les fichiers conservés. La frise montre chaque appel dans l’ordre (case vide = appel refusé) :
Xiaomi MiMo v2.6 Pro (essai 1)
Rang 1 · score 100 · robuste · cloud via opencode
⚑ A connu le résultat de l'achat-conservation de la période scellée — Son raisonnement cite le chiffre de l'achat-conservation sur la période scellée (+201,8 %), qui était visible dans une consigne et sur la page publique.
Appels d’outils47 · 68 % réussis
Durée21,9 min
Balayages réussis / lancés3 / 17
Backtests réussis / lancés10 / 10
Lectures de la doc5 (tools/list ×3, get_sandbox_capabilities ×1, list_sandbox_datasets ×1)
Premier test à l’appel16
Test à l’aveugleoui (30 % mis de côté)
Erreurs les plus fréquentessandbox.preflight_failed ×10, sandbox.sweep_parameter_unsupported ×4, missing_strategy_input ×1
Tentatives sur données scellées0
Méthode : Lecture large de la documentation (contrat du moteur, exploration du Lab) et assemblage de plusieurs scripts avant le premier test, puis série de balayages refusés. Pistes visibles dans les refus : filtre ADX, paramètre de régime.
Pistes explorées : croisement de deux moyennes, prix au-dessus d'une moyenne, filtre ADX, filtre de régime
Vérifications annoncées : non disponibles (raisonnement abrégé)
Choix de la stratégie principale : Non détaillé dans le fichier conservé (raisonnement abrégé).
Muse Spark 1.3 (contributor, free) (essai 1)
Rang 2 · score 100 · robuste · cloud via opencode
Appels d’outils34 · 85 % réussis
Durée5,5 min
Balayages réussis / lancés1 / 3
Backtests réussis / lancés17 / 18
Lectures de la doc5 (tools/list ×3, get_sandbox_capabilities ×1, list_sandbox_datasets ×1)
Premier test à l’appel9
Test à l’aveugleoui (30 % mis de côté)
Erreurs les plus fréquentesSANDBOX_ARGUMENTS_INVALID ×4, sandbox.sweep_parameter_unsupported ×1
Tentatives sur données scellées0
Méthode : Documentation, construction et validation du script (8 appels avant le premier test), puis backtests ciblés : découpe 70/30 refaite à la main, trois sous-périodes (hausse, baisse, reprise) et longueurs voisines. Un balayage de 50 variantes de sorties (stop, objectif, durée) avec 30 % mis de côté a montré que ces sorties faisaient moins bien que laisser courir.
Pistes explorées : prix au-dessus d'une moyenne simple (100 à 300), sorties par stop, objectif ou durée, canal Turtle 20
Vérifications annoncées : test à l’aveuglesous-périodesréglages voisinscomparaison à l’achat-conservation
Choix de la stratégie principale : Le centre d'une zone 100-300 toutes positives, pas le meilleur réglage d'entraînement (250).
deepseek-flash (essai 1)
Rang 3 · score 100 · robuste · cloud via opencode
Appels d’outils21 · 100 % réussis
Durée5,7 min
Balayages réussis / lancés9 / 9
Backtests réussis / lancés11 / 11
Lectures de la doc0 ()
Premier test à l’appel1
Test à l’aveugleoui (25 % mis de côté)
Erreurs les plus fréquentesaucune
Tentatives sur données scellées0
Méthode : 9 balayages (dont deux de 120 variantes classées de deux façons), puis 11 backtests : carte de la zone stable (moyenne courte 12-26, longue 236-320), trois durées de sortie, années 2021 et 2022 séparées, frais à 0 %, 0,1 % et 0,3 % par côté.
Pistes explorées : deux moyennes à l'achat et à la vente, puis à l'achat seul avec sortie au bout d'un temps fixe
Vérifications annoncées : test à l’aveuglesous-périodesréglages voisinscomparaison à l’achat-conservationfrais plus élevés
Choix de la stratégie principale : Le centre de la zone stable, avec le meilleur rapport gain / pire baisse sur les données de recherche ; il note que sa partie mise de côté fait moins bien que l'achat-conservation.
Claude Sonnet 5 (essai 1)
Rang 4 · score 80 · exploratoire · agent Claude
Appels d’outils43 · 98 % réussis
Durée2,5 min
Balayages réussis / lancés19 / 19
Backtests réussis / lancés15 / 16
Lectures de la doc5 (tools/list ×2, get_sandbox_capabilities ×2, list_sandbox_datasets ×1)
Premier test à l’appel8
Test à l’aveugleoui (30 % mis de côté)
Erreurs les plus fréquentessandbox.preflight_failed ×1
Tentatives sur données scellées0
Méthode : Lecture courte de la documentation, puis alternance de backtests et de balayages, jusqu'à 800 réglages d'un coup avec une partie des données mises de côté. A constaté que les entrées « prix au-dessus d'une moyenne » ne se refermaient jamais dans ce moteur, et a construit ses entrées sur des croisements, qui se referment au croisement inverse. Stops et stops suiveurs testés puis abandonnés.
Pistes explorées : croisements de moyennes simples et exponentielles, stops fixes et suiveurs
Vérifications annoncées : test à l’aveuglesous-périodesréglages voisinscomparaison à l’achat-conservation
Choix de la stratégie principale : Entre deux candidates proches, celle qui faisait mieux sur les données mises de côté et sur la dernière année.
Xiaomi MiMo v2.6 Pro (essai 2)
Rang 5 · score 80 · exploratoire · cloud via opencode
Appels d’outils47 · 51 % réussis
Durée16,6 min
Balayages réussis / lancés4 / 11
Backtests réussis / lancés10 / 19
Lectures de la doc3 (tools/list ×1, get_sandbox_capabilities ×1, list_sandbox_datasets ×1)
Premier test à l’appel14
Test à l’aveugleoui (40 % mis de côté)
Erreurs les plus fréquentesSANDBOX_ARGUMENTS_INVALID ×17, missing_strategy_input ×3, unsupported_condition ×1
Tentatives sur données scellées0
Méthode : Documentation, construction et validation, puis 9 refus d'affilée en ajoutant un champ manquant par essai. Une fois la requête correcte : balayages avec 30 et 40 % mis de côté, grilles de réglages voisins, trois sous-périodes et un achat-conservation de contrôle. A calculé que « exploratoire » rapportait plus en moyenne que s'abstenir.
Pistes explorées : croisement de deux moyennes, canal de prix
Vérifications annoncées : test à l’aveuglesous-périodesréglages voisinscomparaison à l’achat-conservation
Choix de la stratégie principale : Le réglage le plus régulier d'une découpe à l'autre.
Claude Opus 5.5 (essai 1)
Rang 6 · score 70 · robuste · agent Claude
Appels d’outils27 · 85 % réussis
Durée2,9 min
Balayages réussis / lancés11 / 13
Backtests réussis / lancés2 / 2
Lectures de la doc4 (tools/list ×2, get_sandbox_capabilities ×1, list_sandbox_datasets ×1)
Premier test à l’appel7
Test à l’aveugleoui (50 % mis de côté)
Erreurs les plus fréquentesSANDBOX_ARGUMENTS_INVALID ×1, sandbox.preflight_failed ×1, unknown_native_family ×1
Tentatives sur données scellées0
Méthode : Documentation, un script de base validé, puis 13 balayages de réglages et 2 backtests de contrôle à la fin. Les filtres ajoutés (ADX, croisement de deux moyennes) faisaient moins bien sur les données mises de côté et ont été écartés. Il a remarqué qu'un nom de paramètre non déclaré ne changeait rien au résultat et a corrigé ; jamais plus de 2 refus d'affilée.
Pistes explorées : prix au-dessus d'une moyenne longue, filtre ADX, croisement de deux moyennes
Vérifications annoncées : test à l’aveuglesous-périodesréglages voisinscomparaison à l’achat-conservation
Choix de la stratégie principale : La longueur la meilleure sur toutes les tranches récentes (deux découpes à l'aveugle et la dernière année), avec la plus faible baisse sur l'ensemble.
Claude Fable 5.1 (essai 2)
Rang 6 · score 70 · robuste · agent Claude
Appels d’outils55 · 98 % réussis
Durée9,8 min
Balayages réussis / lancés14 / 15
Backtests réussis / lancés19 / 19
Lectures de la doc6 (tools/list ×4, get_sandbox_capabilities ×1, list_sandbox_datasets ×1)
Premier test à l’appel11
Test à l’aveugleoui (40 % mis de côté)
Erreurs les plus fréquentessandbox.sweep_parameter_unsupported ×1
Tentatives sur données scellées0
Méthode : Exploration plus large des outils du Lab au début et après les premiers backtests (familles toutes faites, espace de balayage, contrat du moteur), puis balayages et backtests en alternance. Découpes à l'aveugle de 20 à 50 % et tranches par régime (baisse, marché sans direction).
Pistes explorées : prix au-dessus d'une moyenne simple ou exponentielle, croisements, double moyenne, confirmation par momentum, ADX, stop suiveur
Vérifications annoncées : test à l’aveuglesous-périodesréglages voisinscomparaison à l’achat-conservation
Choix de la stratégie principale : Le centre de la zone stable (moyennes 196-308).
Claude Sonnet 5 (essai 2)
Rang 8 · score 70 · robuste · agent Claude
Appels d’outils35 · 71 % réussis
Durée1,9 min
Balayages réussis / lancés7 / 8
Backtests réussis / lancés4 / 10
Lectures de la doc8 (tools/list ×4, get_sandbox_capabilities ×3, list_sandbox_datasets ×1)
Premier test à l’appel17
Test à l’aveugleoui (30 %, 50 % mis de côté)
Erreurs les plus fréquentesSANDBOX_ARGUMENTS_INVALID ×6, unknown_native_family ×3, sandbox.preflight_failed ×1
Tentatives sur données scellées0
Méthode : 16 appels avant le premier test : documentation et plusieurs noms de familles toutes faites inexacts. Ensuite, un balayage d'une seule longueur de moyenne (30 à 400), une comparaison avec les croisements de deux moyennes et des backtests de contrôle. Pas de position vendeuse, en citant des résultats antérieurs du projet.
Pistes explorées : prix au-dessus d'une moyenne simple, croisement de deux moyennes
Vérifications annoncées : test à l’aveugleréglages voisinscomparaison à l’achat-conservation
Choix de la stratégie principale : Le milieu de la zone stable.
deepseek-flash (essai 2)
Rang 9 · score 70 · robuste · cloud via opencode
Appels d’outils24 · 79 % réussis
Durée5,3 min
Balayages réussis / lancés6 / 6
Backtests réussis / lancés2 / 2
Lectures de la doc5 (tools/list ×3, get_sandbox_capabilities ×1, list_sandbox_datasets ×1)
Premier test à l’appel16
Test à l’aveugleoui (20 %, 35 % mis de côté)
Erreurs les plus fréquentesunsupported_condition ×3, invalid_parameter_metadata ×1, invalid_number ×1
Tentatives sur données scellées0
Méthode : 15 appels avant le premier test, surtout pour faire valider le script. Ensuite une courbe de 18 longueurs (60 à 400), deux découpes chronologiques (65/35 et 80/20), trois sous-périodes de régime et un achat-conservation mesuré avec le même moteur.
Pistes explorées : une seule famille : prix au-dessus d'une moyenne simple
Vérifications annoncées : test à l’aveuglesous-périodesréglages voisinscomparaison à l’achat-conservation
Choix de la stratégie principale : Le haut d'une zone stable (160 à 400 toutes positives) ; il signale lui-même la découpe 80/20 négative.
Claude Fable 5.1 (essai 1)
Rang 10 · score 70 · robuste · agent Claude
Appels d’outils45 · 96 % réussis
Durée6,9 min
Balayages réussis / lancés31 / 32
Backtests réussis / lancés4 / 4
Lectures de la doc5 (tools/list ×3, get_sandbox_capabilities ×1, list_sandbox_datasets ×1)
Premier test à l’appel9
Test à l’aveugleoui (40 % mis de côté)
Erreurs les plus fréquentessandbox.sweep_parameter_unsupported ×1, unsupported_directive ×1
Tentatives sur données scellées0
Méthode : Documentation, un script de base, puis presque uniquement des balayages : chaque réglage cherché sur la partie ancienne et rejoué sur une fin de données intacte (de 20 à 50 % mis de côté), puis contrôlé sur trois années séparées. Les deux refus venaient de paramètres non pris en charge, abandonnés aussitôt.
Pistes explorées : prix au-dessus d'une moyenne simple ou exponentielle, croisements, ADX, filtre de régime, momentum, canal de Donchian
Vérifications annoncées : test à l’aveuglesous-périodesréglages voisinscomparaison à l’achat-conservation
Choix de la stratégie principale : Positive sur 6 découpes sur 7, plus petite perte en année baissière, réglages au milieu de zones larges.
Muse Spark 1.3 (contributor, free) (essai 2)
Rang 11 · score 70 · robuste · cloud via opencode
Appels d’outils32 · 88 % réussis
Durée4,6 min
Balayages réussis / lancés5 / 6
Backtests réussis / lancés10 / 10
Lectures de la doc6 (tools/list ×4, get_sandbox_capabilities ×1, list_sandbox_datasets ×1)
Premier test à l’appel13
Test à l’aveugleoui (30 % mis de côté)
Erreurs les plus fréquentesSANDBOX_ARGUMENTS_INVALID ×1, unsupported_condition ×1, sandbox.preflight_failed ×1
Tentatives sur données scellées0
Méthode : Documentation et validation (12 appels avant le premier test), puis balayages de 150 variantes avec 30 % des données mises de côté et backtests sur toute la période. Vérifications : trois sous-périodes, 9 réglages de sortie voisins, longueurs de canal 20, 55 et 100.
Pistes explorées : moyenne 200, canal de Donchian 55, croisement 50/200, moyenne exponentielle 50 avec ADX ; à l'achat seulement, avec stop, objectif et durée maximale
Vérifications annoncées : test à l’aveuglesous-périodesréglages voisins
Choix de la stratégie principale : Un paramètre classique (Turtle, système 2) plutôt qu'un réglage issu de la recherche.
Claude Opus 5.5 (essai 2)
Rang 12 · score 70 · robuste · agent Claude
Appels d’outils32 · 78 % réussis
Durée3,3 min
Balayages réussis / lancés7 / 12
Backtests réussis / lancés9 / 9
Lectures de la doc5 (tools/list ×2, get_sandbox_capabilities ×2, list_sandbox_datasets ×1)
Premier test à l’appel8
Test à l’aveugleoui (33 % mis de côté)
Erreurs les plus fréquentessandbox.preflight_failed ×3, sandbox.sweep_parameter_unsupported ×2, SANDBOX_ARGUMENTS_INVALID ×1
Tentatives sur données scellées0
Méthode : Documentation (5 lectures), essais de familles toutes faites du Lab, puis 12 balayages et 9 backtests finaux pour découper les résultats par année. Les croisements de deux moyennes étaient bons sur l'entraînement mais instables à l'aveugle ; les filtres ajoutés n'apportaient rien.
Pistes explorées : croisements de deux moyennes, filtres ADX et alignement de moyennes, prix au-dessus d'une moyenne exponentielle de 100 à 600
Vérifications annoncées : test à l’aveuglesous-périodesréglages voisinscomparaison à l’achat-conservation
Choix de la stratégie principale : Le centre de la zone stable plutôt que le meilleur score d'entraînement, jugé trop proche d'une chute.
Claude Haiku 4.5 (essai 1)
Rang 13 · score 10 · exploratoire · agent Claude
Appels d’outils18 · 89 % réussis
Durée3,0 min
Balayages réussis / lancés0 / 0
Backtests réussis / lancés0 / 0
Lectures de la doc1 (tools/list ×1)
Premier test à l’appel—
Test à l’aveugleaucun balayage n’a tourné
Erreurs les plus fréquentesoperation_in_progress ×1, no_error_detail ×1
Tentatives sur données scellées0
Méthode : Lecture du contrat du moteur et des familles toutes faites, puis manches de démonstration et preuves rapides. Les chiffres cités dans la soumission (validation glissante, probabilité de sur-ajustement) viennent de ce jeu d'exemple.
Pistes explorées : croisement de moyennes simples, RSI de retour à la moyenne, croisement de moyennes exponentielles
Vérifications annoncées : aucune
Choix de la stratégie principale : La meilleure variante sur le jeu d'exemple.
Claude Haiku 4.5 (essai 2)
Rang 14 · score 0 · robuste · agent Claude
Appels d’outils36 · 39 % réussis
Durée4,3 min
Balayages réussis / lancés0 / 14
Backtests réussis / lancés1 / 6
Lectures de la doc4 (tools/list ×2, get_sandbox_capabilities ×1, list_sandbox_datasets ×1)
Premier test à l’appel9
Test à l’aveugleaucun balayage n’a tourné
Erreurs les plus fréquentesSANDBOX_ARGUMENTS_INVALID ×16, sandbox.request_schema ×3, unsupported_condition ×1
Tentatives sur données scellées0
Méthode : Lecture de la documentation et des suggestions du Lab, puis balayages envoyés avant d'avoir lu le format de requête attendu ; la lecture des capacités de l'appli est venue après cinq refus.
Pistes explorées : croisement 20/50 avec filtre ADX, alignement de trois moyennes, RSI de retour à la moyenne ; toutes à l'achat et à la vente, avec stops et objectifs serrés
Vérifications annoncées : aucune
Choix de la stratégie principale : Choisie sur principe (double confirmation de tendance) et étiquetée « robuste » sans mesure.
Nemotron 3.5 Lightning (free)
Non jouée / simulée · score 0
⚑ Recherche simulée — Aucun appel d'outil enregistré ; résultats décrits sans calcul.
Appels d’outils0
Tentatives2
Journal scelléaucun
Méthode : Pas de recherche : la soumission décrit une méthode (découpe à l'aveugle, sous-périodes) qui n'a jamais été exécutée.
Ce qu’il a rendu comme « script »
run_sandbox_sweep({ data_set: "ohlcv-sha256-9f8ce49cc04885b6", start: "2020-10-01", end: "2023-09-30", holdoutPercent: 20, strategy: "ema_cross", params: {fast: 12, slow: 26, signal: 9}, feeBps: 10, benchmark: "sharpe" })