Agentic Vulnerability Research for Code Assess
Überblick
Agentische Schwachstellenforschung für Code umfasst Tools, die LLM-Agenten über gestufte Pipelines orchestrieren, um Sicherheitsdefekte im Quellcode zu finden, zu validieren und teils zu patchen. Das Muster ist über Implementierungen hinweg konsistent: tool-vermittelte Analyse, aufgeteilt in Discovery, Evidenzsammlung, skeptische Validierung von Kandidaten-Findings und Reporting, mit optionaler Remediation und Patch-Verifikation am Ende. Google beschreibt dies als gestufte, expertenorchestrierte agentische Source-Code-Review, und dieselbe Zerlegung findet sich in der breiteren Literatur zur agentischen Vulnerability Discovery.
Auf den Radar gelangte die Kategorie, weil sie den Demo-Status verlassen hat. open-kritt ist ein selbst gehosteter, Open-Source-Orchestrator zum Finden und Validieren von Issues in Code und hat seit Juli 2026 nennenswerte Stars gesammelt; Capital Ones VulnHunter und Visas VVAH sind Produktions-Tools regulierter Institutionen, die als offener Code veröffentlicht wurden; OpenAIs Aardvark ist jetzt Codex Security, verfügbar als Research Preview; und kommerzielle Plattformen integrieren agentisches Scanning zunehmend neben deterministischen Engines, statt es standalone auszuliefern.
Die Kategorie liegt in Assess statt Trial, weil die Evidenz für Gleichwertigkeit mit etablierten Kontrollen fehlt. Eine empirische Studie fragt explizit, ob Open-Source-LLM-Agenten SAST-Tools ersetzen können, und bewertet sie nach Precision, Recall und False Positives – eine Frage, die weiterhin offen ist. Behandeln Sie diese Tools als Ergänzung zu Secure Code Review und SAST und konzipieren Sie eine Evaluierung, keine Migration.
Adoptionssignale
- Open-Source-Zugkraft rund um open-kritt, einen selbst gehosteten Orchestrator für agentengetriebene Discovery und Validierung in Code, der seit Juli 2026 die 2.000-Stars-Marke überschritten hat.
- OpenAIs Aardvark wechselte von der privaten Beta zu Codex Security als Research Preview und wird über Codex Web für ChatGPT Enterprise, Business und Edu ausgerollt.
- Zwei regulierte Fortune-Scale-Unternehmen veröffentlichten internes Tooling: Capital Ones VulnHunter erschien unter Apache 2.0 als komposable Claude-Code-Skills mit headless CI/CD-Agent und Benchmarking-Harness, nach Validierung über tausende Repositories, und Visas VVAH wuchs von 595 Stars im Juli auf über 2.300 bis Ende August 2026.
- Googles Threat-Intelligence-Team legte die Architektur seines Agentic Vulnerability Discovery Harness offen, eingesetzt in proaktiven Reviews, Pentests, Red-Team-Operationen und Incident Response, positioniert als Schicht neben kontinuierlichem Scanning.
- Kommerzielle Konsolidierung: Cycode routet deterministische und agentische Analyse nun als ein System und rahmt Modellwahl, Scan-Kadenz und Auditierbarkeit explizit als die entscheidenden Fragen.
- Ein unterstützendes Framework- und Benchmark-Ökosystem entsteht, darunter CVE-Factory und LiveCVEBench mit 190 Aufgaben über 14 Sprachen und 153 Repositories, neben Agent-Frameworks wie Alias Robotics' CAI – dessen Archivierungsstatus selbst eine Erinnerung daran ist, wie sehr Projekte in diesem Bereich fluktuieren.
Risiken
- Kein SAST-Ersatz. Die unabhängige Evaluierung von Open-Source-LLM-Agenten gegenüber Static-Application-Security-Testing-Tools behandelt die Substitution als offene empirische Frage, weshalb das Abschalten regelbasierter Kontrollen auf Basis von Agenten-Findings verfrüht ist.
- Schreibzugriff standardmäßig. VVAH bearbeitet Quelldateien, sofern Operatoren es nicht explizit auf Detection-only beschränken, und führt eine adversarielle Validierung durch, bevor ein Mensch den Fix sieht.
- Validierung und Audit-Trail sind der schwierige Teil. Kommentare zu VVAH argumentieren, der dauerhafte Wert liege in der Validierungsschicht und dem Audit-Trail – dem Nachweis gegenüber einem Auditor, dass ein maschinell geschriebener Patch von etwas überprüft wurde –, und Cycode rahmt „welches Modell welches Finding produziert hat“ als Frage, für die die meisten AppSec-Programme nie ausgelegt waren.
- Die Harness vergrößert Ihre Angriffsfläche. Die Cloud Security Alliance protokollierte mehr als 30 CVEs im MCP-Ökosystem zwischen Januar und März 2026, darunter einen Pre-Auth-RCE-Pfad mit CVSS 9.6, und dokumentierte die Weaponisierung einer Auth-Schwachstelle eines agentischen Frameworks in unter vier Stunden.
- Prompt Injection erreicht die Analyse-Pipeline. Eine Systematisierung von Prompt Injection gegen agentische Coding-Assistenten fasst 78 Studien zu Angriffen über Skills, Tools und Protokoll-Ökosysteme zusammen – direkt relevant, wenn der Agent auf nicht vertrauenswürdige Repositories angesetzt wird.
- Vendor- und Projekt-Volatilität. CAI wandelte sich innerhalb von achtzehn Monaten von einem De-facto-Open-Framework zu einem einzigen Archivierungs-Commit; behandeln Sie jedes einzelne Tool dieser Kategorie als austauschbar.
Vorteile & Nachteile
Vorteile
- Multi-Agent-Harnesses gliedern die Arbeit in Discovery, skeptische Validierung und Reporting – Googles AVDH-Team attestiert dem einen messbaren Effizienzsprung gegenüber unstrukturiertem Model-Prompting.
- Agentische Analyse kann über semantische Fehlerklassen räsonieren, die Regel-Engines nicht ausdrücken können, wie Cycode für Authorization-CVEs berichtet, die deterministische Engines im Benchmark-Test übersehen haben.
- Es existieren inzwischen glaubwürdige Open-Source-Implementierungen zur Evaluierung ohne Vendor-Bindung, darunter open-kritt, Capital Ones VulnHunter und Visas VVAH-Remediation-Harness.
Nachteile
- Empirische Arbeiten stellen infrage, ob Open-Source-LLM-Agenten Static-Application-Security-Testing-Tools ersetzen können, weshalb ein Ablösen bestehender SAST-Kontrollen noch nicht vertretbar ist.
- Remediation-fähige Harnesses wie VVAH bearbeiten standardmäßig Quelldateien und verlangen von Operatoren, explizit einen Detection-only-Modus zu aktivieren – eine leicht mögliche Fehlkonfiguration mit Produktionsfolgen.
- Die agentische Tooling-Schicht ist selbst eine Angriffsfläche: Die Cloud Security Alliance verzeichnete in sechzig Tagen über 30 CVEs im MCP-Ökosystem, und eine PraisonAI-Auth-Schwachstelle wurde in unter vier Stunden weaponisiert.
Empfehlung
Stellen Sie eine agentische Harness gegen Repositories auf, die Sie bereits gut kennen, und messen Sie sie, statt sie zuerst auf Ihre Kronjuwelen anzusetzen. Betreiben Sie open-kritt oder VulnHunter ein Quartal lang parallel zu Ihrem bestehenden SAST und bewerten Sie Findings nach Precision, Recall und False-Positive-Volumen – denselben Achsen wie in der SAST-Vergleichsstudie –, damit die Assess-Entscheidung auf Ihrer Codebasis beruht und nicht auf einem Vendor-Benchmark. Öffentliche Benchmarks wie LiveCVEBench sind nützlich zur Triage von Kandidaten, ersetzen aber keine lokale Baseline.
Halten Sie Agenten zunächst im Detection-only-Modus. Falls Sie eine Remediation-Harness evaluieren, fixieren Sie die Konfiguration explizit – VVAH schreibt standardmäßig in Quelldateien – und verlangen Sie menschliches Review plus einen Audit-Eintrag für jeden maschinell verfassten Patch. Übernehmen Sie die strukturelle Lehre aus Googles AVDH: Der Effizienzgewinn kam von erzwungenen skeptischen Validierungsschritten und injizierter menschlicher Expertise, nicht von einem stärkeren Modell. Budgetieren Sie Triage-Kapazität entsprechend; unvalidierte Agenten-Ausgaben werden AppSec-Aufmerksamkeit binden, statt sie freizusetzen.
Behandeln Sie die Harness selbst als Produktionsinfrastruktur unter Bedrohung. Isolieren Sie sie, beschränken Sie Credentials und Tool-Zugriff eng, pinnen und überwachen Sie jeden von ihr genutzten MCP-Server angesichts des dokumentierten CVE-Volumens in diesem Ökosystem, und gehen Sie davon aus, dass nicht vertrauenswürdiger Code unter Analyse Prompt Injection über Skills und Tools versuchen könnte. Prüfen Sie im nächsten Quartal erneut: Wenn die Precision validierter Findings hält und Audit-Trails Ihre Compliance-Prüfer zufriedenstellen, ist dies ein Trial-Kandidat.
Quellen
- Kritt-ai/open-kritt
- Introducing Aardvark: OpenAI's agentic security researcher (now Codex Security)
- Staying Ahead of Adversarial AI Through Agentic Source Code Review — Google Cloud
- VulnHunter: Capital One Open-Sources an Agentic Security Scanner
- Visa open-sources VVAH agentic security tool for code fixes
- Cycode Releases Agentic Code Scanning and Attack Chaining
- Can Open-Source LLM Agents Replace Static Application Security Testing Tools?
- CVE-Factory: Scaling Expert-Level Agentic Tasks for Code
- Agentic Vulnerability Discovery — overview
- Cybersecurity AI (CAI) framework
- CVE and CWE Agentic Vulnerability Catalog — Cloud Security Alliance
- Sub-4-Hour Weaponization of Agentic AI Frameworks
- Prompt Injection Attacks on Agentic Coding Assistants (SoK)