Sécurité · 7 min
pentest-ai-agents : 50 agents Claude + 150 outils pentest connectés (à lancer uniquement sur tes propres projets)
Une stack offensive cybersécurité entière branchée sur Claude. 50 agents spécialisés + 150+ outils de pentest connectés via MCP. Tu donnes ton URL, les agents lancent reconnaissance, analyse, exploitation, rapport.
Ce qu’il y a dedans
- ⚠️ Avant de continuer : ce que tu dois savoir
- C'est quoi exactement
- Le modèle à 2 niveaux de sécurité
- Performances annoncées par le créateur
Une stack offensive cybersécurité entière branchée sur Claude. 50 agents spécialisés + 150+ outils de pentest connectés via MCP. Tu donnes ton URL, les agents lancent reconnaissance, analyse, exploitation, rapport. Résultat : un audit sécurité complet sans toucher au clavier, en quelques minutes.
⚠️ Avant de continuer : ce que tu dois savoir
Cet outil est un offensive security framework. Il peut générer du trafic d'attaque, exploiter des failles, exfiltrer des données. C'est PAS un scanner défensif.
Tu peux le lancer uniquement sur :
- Tes propres projets (sites, apps, serveurs que tu possèdes)
- Les programmes de bug bounty publics où la cible t'autorise explicitement (HackerOne, YesWeHack, Intigriti)
- Des systèmes pour lesquels tu as un mandat écrit du propriétaire (clients qui t'engagent pour un pentest)
Lancer sur n'importe quoi d'autre = infraction pénale. Dans la majorité des juridictions européennes, c'est jusqu'à 5 ans de prison + des dommages-intérêts massifs. Le repo est légal à utiliser, l'usage qu'on en fait engage ta seule responsabilité. Joue pas avec ça.
Maintenant qu'on est OK : si t'as un site à toi, un projet client mandaté ou un programme bug bounty actif, c'est probablement l'outil le plus puissant que t'aies testé cette année.
C'est quoi exactement
Open source sur GitHub : github.com/0xSteph/pentest-ai-agents. Créé par 0xSteph, security researcher. Lancé récemment, en croissance rapide.
Le package contient deux choses :
- 50 sub-agents Claude Code spécialisés. Chacun expert dans un domaine offensif :
- Reconnaissance (recon, AI-recon, OSINT)
- Web app testing (injection, auth, business logic)
- Active Directory attacks
- Cloud security (AWS, Azure, GCP)
- Mobile (iOS, Android)
- Wireless
- Social engineering
- Exploit chaining
- Detection engineering
- Forensics, malware analysis
- Post-exploitation (évasion, persistance, lateral movement)
- Crypto, password, code auditing
- Rapport et compliance
- Un MCP server compagnon (pentest-ai) avec 150+ outils intégrés. C'est la stack exacte d'un consultant senior :
- Outils de reco : nmap, masscan, amass, subfinder, httpx, nuclei
- Outils d'exploit : sqlmap, ffuf, dirsearch, burpsuite CLI
- Outils crypto : hashcat, john, hydra
- Outils cloud : prowler, scoutsuite, cloudsploit
- Outils mobile : MobSF, frida
- Et 130+ autres
Claude orchestre tout. Tu lui donnes le scope, il choisit les bons outils, lance les bonnes commandes, agrège les résultats.
Le modèle à 2 niveaux de sécurité
C'est ce qui rend l'outil utilisable sans se faire peur.
Tier 1 — Mode advisory
Les agents tournent en mode conseiller. Tu colles le output d'un outil que t'as lancé toi-même, ils analysent, prioritisent, te disent quoi faire ensuite. Aucune commande n'est exécutée automatiquement. Risque zéro de lancer un truc par erreur.
Mode parfait pour démarrer ou pour les missions où le client veut tout valider à la main.
Tier 2 — Mode exécution autonome avec approbation
Les agents composent les commandes et les exécutent directement contre le scope que t'as déclaré. Avant chaque commande, Claude Code affiche la commande et te demande une approbation explicite. Tu valides ou tu refuses. Une commande = un clic.
Mode pour les vrais audits où tu veux que ça aille vite tout en gardant le contrôle.
Tu peux changer de tier au milieu d'une mission. Tu commences en Tier 1 sur les phases sensibles, tu bascules en Tier 2 sur les phases routinières.
Performances annoncées par le créateur
À prendre comme un ordre de grandeur, pas un chiffre garanti sur ton cas précis. Les vrais résultats dépendent du scope, de la stack cible, de la qualité de ton scope brief.
Setup en 10 minutes
Prérequis
- Claude Code installé
- Node.js + Python 3.11+ (pour les wrappers d'outils)
- Un environnement isolé (VM, container Docker, ou kali Linux dédié). Jamais sur ta machine perso de tous les jours.
- Connexion Internet, et de préférence un VPN ou une IP dédiée pour pas que tes scans créent du bruit suspect sur ton réseau
Étape 1 — Clone le repo
Dans ton terminal (dans ton environnement isolé) :
git clone https://github.com/0xSteph/pentest-ai-agents.git
cd pentest-ai-agents
Étape 2 — Installe les sub-agents Claude Code
./install.sh
Le script copie les 50 sub-agents dans ~/.claude/agents/. Ils deviennent disponibles dans toutes tes sessions Claude Code.
Étape 3 — Branche le MCP server pentest-ai (les 150+ outils)
claude mcp add pentest-ai -- python -m pentest_ai.mcp_server
Claude Code peut maintenant exécuter n'importe quel outil de la stack. Au premier lancement, il détecte ce qui manque sur ton système et te liste les installs à faire (nmap, sqlmap, etc.).
Étape 4 — Déclare ton scope
Crée un fichier scope.yaml à la racine de ton projet :
authorized_targets:
- mondomaine.com
- *.mondomaine.com
- 203.0.113.42
authorization_proof:
- "Je suis propriétaire de mondomaine.com (whois)"
- "Mandat client n° 2026-05 signé le 15/05/2026"
out_of_scope:
- production.mondomaine.com (prod live, pas de test ici)
- api-externe.com (tier non sous mon contrôle)
mode: tier1
Claude Code refuse d'attaquer toute cible qui n'est pas explicitement dans authorized_targets. C'est ton garde-fou.
Étape 5 — Premier audit
Dans Claude Code :
Utilise les agents pentest pour faire un audit complet de scope.yaml. Commence par la reconnaissance, puis web app, puis rapport final.
Claude orchestre, te montre chaque commande avant exécution, agrège les findings. À la fin tu reçois un rapport Markdown structuré par criticité.
5 missions concrètes que tu peux lui donner
1. Audit complet de ton propre site avant production
« Audit complet du staging de [mondomaine.com]. Trouve tout : OWASP top 10, mauvaises configs serveur, secrets en clair, dépendances vulnérables, mauvaises pratiques auth. Rapport priorisation P0/P1/P2. »
2. Pré-audit d'un client AVANT signature de mandat
« Reconnaissance externe non-intrusive de [client.com] (juste OSINT et passive recon, pas d'attaques actives). Sors-moi tout ce qui est public pour préparer le devis et le scope du futur mandat. »
3. Audit cloud AWS / GCP / Azure
« Lance prowler et scoutsuite sur mon compte AWS [account-id]. Cherche les buckets S3 publics, les IAM trop permissifs, les secrets dans les EC2 metadata, les groupes de sécurité ouverts. »
4. Bug bounty sur un programme actif
« Programme HackerOne [nom], scope [domaines autorisés]. Cherche les RCE, SSRF, IDOR, authentication bypass. Respecte strictement le scope, document chaque finding avec PoC reproductible. »
5. Code audit en plus du pentest
« Active code-auditor sur mon repo local. Cherche les secrets en clair, les vulns d'injé (SQL, XSS, command), les dépendances obsolètes avec CVE connues, les permissions trop larges. »
Mes 3 conseils
- Commence toujours en Tier 1 sur une cible que tu connais. Sur le premier audit, choisis un de tes sites que tu connais déjà par cœur. Tu vas voir si Claude trouve les failles que toi tu connais (validation que le tool marche), et tu vas voir ce qu'il trouve EN PLUS (la valeur ajoutée réelle).
- Garde un fichier de scope clair et légalement béton. Avant chaque mission, document : qui m'autorise, sur quoi, jusqu'à quand, quel mode (advisory ou exécution), quelles cibles out-of-scope. C'est ton parapluie juridique. En cas de litige, c'est ce papier qui te sauve.
- Reste sceptique sur les chiffres 98,7 % / 2 % FP. C'est un benchmark interne du créateur. En réel, sur tes audits, tu vas avoir 5-15 % de faux positifs et un taux de détection qui dépend de la stack cible. Le tool est excellent mais c'est pas magique. Toujours valider manuellement chaque finding avant de le mettre dans un rapport client.
Les limites à garder en tête
- C'est offensive, pas défensive. L'outil te dit ce qui ne va pas. Il ne le corrige pas. Pour le fix, tu passes à du code review classique avec Claude Code normal.
- Les outils intégrés peuvent générer beaucoup de trafic. Une reco complète peut envoyer des milliers de requêtes sur ta cible. Si t'es sur un environnement partagé, tu peux te faire bloquer par le WAF du client ou de ton hébergeur. Tj rate-limit dans le scope.yaml.
- Tier 2 demande de la rigueur sur l'approbation. Si tu valides chaque commande sans regarder, t'es exposé. Lis chaque commande avant d'approuver. Surtout celles avec des verbes destructifs (post, delete, exfil).
- Légalement ultra sensible. Je l'ai déjà dit en intro mais je le redis : sur des cibles non-autorisées, c'est de la pénale. Ne lance jamais sur « juste pour voir ». Le repo logge tout, ton fournisseur d'internet logge tout, ta cible logge tout. Trois chemins pour remonter à toi en cas de plainte.
Le mot de la fin
C'est probablement l'outil le plus puissant de l'écosystème Claude Code en 2026. Pour les vrais professionnels de la sécurité, c'est un gain de productivité massif. Pour les entrepreneurs qui veulent auditer leurs propres projets avant production, c'est un audit qui coute 0 € de honoraires de consultant.
Lance-le sur ton propre site cette semaine. En 30 minutes tu auras une liste de failles à corriger que t'aurais probablement ratées en code review normale.
Mais respecte strictement le scope. Toujours.
