LangWatch brengt een open-source framework uit waarmee development teams AI-agents automatisch kunnen testen op geavanceerde aanvalstechnieken. LangWatch Scenario simuleert realistische, meerfasige aanvallen die traditionele pentests niet blootleggen. Het platform richt zich op organisaties die AI-toepassingen in productie draaien, zoals banken, verzekeraars en AI-first softwarebedrijven.
LangWatch, een platform voor het testen en verbeteren van AI-applicaties, introduceert LangWatch Scenario: een open-source framework voor geautomatiseerd red-teamen van AI-systemen. Volgens het bedrijf zijn de echte risico’s van AI-aanvallen vaak niet zichtbaar in gangbare testmethoden, maar schuilen ze in de AI-agents die organisaties zelf bouwen en inzetten voor gevoelige processen.
Meerfasige aanvallen nabootsen
LangWatch stelt dat enkelvoudige pentests niet langer volstaan. Large Language Models kunnen na opeenvolgende interacties alsnog gevoelige informatie prijsgeven, ook als ze een directe aanvalsprompt aanvankelijk weigeren. LangWatch Scenario speelt hierop in door gesprekken gestructureerd op te bouwen via de zogenoemde Crescendo-strategie: een vierfasige escalatie die begint met vriendelijke verkenning, vervolgt met hypothetische vragen en autoriteitsrollen, en eindigt met maximale druk.
Tijdens elke stap beoordeelt een tweede model de voortgang en stuurt het de aanvalsstrategie bij. Zo optimaliseert het geautomatiseerde red-team zijn aanpak terwijl de geteste AI-agent geen extra weerstand opbouwt. Het framework maakt hiermee kwetsbaarheden zichtbaar die standaardtesten niet detecteren, nog voordat die kwetsbaarheden in productie tot schade leiden.
Rogerio Chaves, medeoprichter en CTO van LangWatch, geeft aan dat een AI-agent die elke enkelvoudige aanvalsprompt weigert een vals gevoel van veiligheid geeft. Aanvallers werken in de praktijk niet met één directe vraag, maar voeren tientallen ontspannen gesprekken en bouwen vertrouwen op. Als een agent na meerdere beurten in een coöperatieve modus staat, worden verzoeken die eerder geweigerd werden plotseling ingewilligd.
Inzetbaar binnen CI-workflows
Het framework is bedoeld voor organisaties die AI-toepassingen opschalen of al in productie hebben draaien, zoals financiële instellingen en AI-first softwarebedrijven. De systemen die het test variëren van klantenservicebots tot data-analyse-agents met toegang tot kritische bedrijfsprocessen. LangWatch meldt dat het framework integreerbaar is binnen bestaande ontwikkel- en Continuous Integration-workflows, zodat AI-veiligheid een vast onderdeel wordt van het ontwikkelproces.
Organisaties zoals Backbase, Altura, Skai en PagBank gebruiken het LangWatch-platform al en breiden dit volgens het bedrijf nu uit met geautomatiseerde red-team tests.
Manouk Draisma, medeoprichter en CEO van LangWatch, benadrukt dat succesvolle aanvallen op AI-systemen zelden bestaan uit één spectaculaire hack. Een aanvaller die twintig minuten stelselmatig met een AI-agent interacteert, kan gevoelige informatie boven water krijgen die een directe aanval nooit zou prijsgeven. LangWatch Scenario beoogt deze verborgen risico’s zichtbaar te maken voordat er schade ontstaat.
Open source en direct beschikbaar
LangWatch Scenario is volledig open source en direct beschikbaar. Het bedrijf kondigt aan dat het framework de basis vormt voor een bredere set red-teamoplossingen, waarbij nieuwe aanvalstechnieken het werkelijke gedrag van AI-systemen in de praktijk volgen. De documentatie en broncode zijn beschikbaar via langwatch.ai/llm-red-teaming en github.com/langwatch/scenario.