From Test Data to Trust: How AI Governance Becomes Reality in the Software Lifecycle

Recap of Matthias Zieger’s talk at Swiss Testing Day 2026

AI is already part of the software supply chain — but who controls the decisions? Matthias Zieger, Field CTO international at Curiosity Software, showed at Swiss Testing Day 2026 why explainable AI governance is the key to trustworthy releases and how release risk gates work in practice in regulated environments.


Key Takeaways

  • AI agents are already making decisions in test and release processes, often without documenting why
  • The paradigm shift from deterministic to non-deterministic demands new control mechanisms
  • Three actors must be auditable: human, tool, and agent – each with its own label
  • Data silos are the biggest obstacle to AI governance, not AI itself
  • Release risk gates with human-in-the-loop connect speed with compliance

The Starting Point: Speed Meets Regulation

With 30 years of industry experience, Matthias Zieger has weathered many technology waves: model-based development, UML code generation, agile transformations. But he has never experienced the pace of change happening right now. And this time, the stakes are higher.

“We operate in regulated environments: banking, insurance, pharma, automotive, medical technology. Lives depend on our systems. So we have to be careful about what we do.”

The core message: Explainable, verifiable AI in the software supply chain

The reality: By end of 2025, nearly 80% of respondents in a US report had already deployed AI in their delivery pipelines. At the same time, many admitted they didn’t know what was actually going on inside the AI. A dangerous combination.


The Paradigm Shift: From Deterministic to Non-Deterministic

For testers, this is a watershed moment. For 27 years, the rule was simple: same input, same output. With Large Language Models, this no longer holds. LLMs can give similar or wildly different answers to the same question depending on prompt quality.

“AI agents really struggle to say: I don’t know. In that sense, agents are a bit like consultants — they don’t dare say I don’t know either. At best, they say ‘it depends.'”

Zieger made clear: AI agents don’t just hallucinate on facts, they hallucinate on self-assessment. An agent will struggle to write in an audit log: “It didn’t work.” Instead, it will say: “I actually did my job quite well.” In regulated environments, this is untenable.


The Silo Problem: Why Governance Fails at the Data Level

The vision: Fast releases plus traceable AI

The underlying problem predates AI. Many organizations still operate in data silos: development in Jira/GitLab, testing in specialized tools, operations in ServiceNow. DevOps has been trying to break down these walls for 20 years. And at the team level, it has often succeeded. But the data remains isolated.

When you unleash AI on isolated data, it learns exactly that: isolation. No traceability, no breadcrumbs from business requirement through development and testing to production. Without traceability, there is no auditability, especially when an autonomous agent made the decision.


Release Risk Gates: AI Governance in Practice

Zieger presented a concrete architecture: a fully automated release risk gate with human-in-the-loop. The approach:

  1. Define risk thresholds: based on system criticality. E-commerce selling cat food? Maybe 60%. Medical devices or aviation? Below 5%.
  2. AI assesses release risk: e.g., “72% probability of failure. 15 failed tests in the payment module.”
  3. Model transparency: Which model was used? With what confidence?
  4. Traceability: Which release, which code changes, which tickets? The entire supply chain becomes visible.
  5. Human decision: Approve, defer, or provide feedback so the model learns.

The continuous learning cycle: production experience flows automatically into test strategies

The key insight: the architecture orchestrates not just tools and humans, but also agents. Zieger referenced the “Periodic Table of DevOps Tools”, and made clear that every tool vendor now also ships an AI agent. Orchestration becomes an order of magnitude more complex.


Lessons Learned from Regulated Environments

Zieger’s conclusion was pragmatic and clear:

  • Full autonomy is a management dream, not reality. Roles change, but humans remain indispensable.
  • Human-in-the-loop at defined checkpoints is not optional, it is mandatory.
  • The model learns: but only when it receives structured feedback from experts.
  • Data quality is the catalyst: AI accelerates good results and bad ones. Poor data quality plus AI equals faster bad results.

“Many dream that AI will optimize away their suboptimal processes. That won’t happen. What will happen: AI will show faster how good the data quality in the software delivery process really is.”


What This Means for Your Team

The mind shift Zieger demands affects both leadership and architecture: not more automation, but explainable automation. AI governance embedded in a platform and compliance strategy. And the honest recognition that the biggest hurdle is not AI itself, but the data silos that have grown over decades.


About the Speaker

Matthias Zieger is Field CTO international at Curiosity Software. With 30 years of industry experience and 27 years in test automation, he combines the practitioner’s perspective with strategic vision.



Based on the talk “Von Testdaten zu Vertrauen – Wie KI Governance im Software-Lifecycle Realität wird” at Swiss Testing Day 2026 in Zurich (Room 6, 10:00–10:30). Conference motto: “Defining Quality in a Dangerous Decade”.

Swiss Testing Day — Switzerland’s leading conference for software quality.


 

Von Testdaten zu Vertrauen: Wie KI-Governance im Software-Lifecycle Realität wird

Rückblick auf den Vortrag von Matthias Zieger am Swiss Testing Day 2026

KI ist längst Teil der Software-Lieferkette — aber wer kontrolliert die Entscheidungen? Matthias Zieger, Field CTO international bei Curiosity Software, zeigte am Swiss Testing Day 2026, warum erklärbare KI-Governance der Schlüssel zu vertrauenswürdigen Releases ist und wie Release-Risk-Gates in regulierten Umgebungen konkret funktionieren.


Key Takeaways

  • KI-Agenten treffen bereits Entscheidungen in Test- und Release-Prozessen, oft ohne dass dokumentiert wird, warum
  • Der Paradigmenwechsel von deterministisch zu nicht-deterministisch erfordert neue Kontrollmechanismen
  • Drei Akteure müssen auditierbar sein: Mensch, Tool und Agent, jeder mit eigener Kennzeichnung
  • Datensilos sind das größte Hindernis für KI-Governance, nicht die KI selbst
  • Release-Risk-Gates mit Human-in-the-Loop verbinden Geschwindigkeit mit Compliance

Die Ausgangslage: Geschwindigkeit trifft auf Regulierung

30 Jahre Industrieerfahrung, und doch: Matthias Zieger hat noch nie eine solche Veränderungsgeschwindigkeit erlebt wie jetzt. Die Parallelen zu früheren Wellen, modellbasierte Entwicklung vor 20 Jahren, UML-Code-Generierung, sind offensichtlich. Und doch ist die Situation fundamental anders. Denn diesmal geht es nicht nur um Produktivität, sondern um Kontrolle.

„Wir sind häufig in regulierten Umgebungen unterwegs — Banken, Versicherungen, Pharmaindustrie, Automobil, Medizintechnik. Da geht es um Leib und Leben. Und deswegen müssen wir aufpassen, was wir da machen.”

Die Kernbotschaft: Erklärbare, überprüfbare KI in der Software-Lieferkette

Die Realität: Ende 2025 setzten laut einem US-Report bereits knapp 80% der Befragten KI in ihrer Delivery Pipeline ein. Gleichzeitig gestanden viele ein, nicht zu wissen, was in der KI eigentlich vorgeht. Eine gefährliche Kombination.


Der Paradigmenwechsel: Von deterministisch zu nicht-deterministisch

Für Tester ist das eine Zäsur. 27 Jahre lang galt: Gleicher Input, gleicher Output. Mit Large Language Models gilt das nicht mehr. Die LLMs geben je nach Prompt-Qualität auf dieselbe Frage manchmal ähnliche, manchmal völlig unterschiedliche Antworten.

„Agenten tun sich ganz schwer damit zu sagen: Ich weiß es nicht. An der Stelle sind Agenten manchmal wie Berater — die trauen sich auch nicht zu sagen: Ich weiß das nicht. Die sagen einfach ‚it depends’ im besten Fall.”

Zieger machte deutlich: KI-Agenten halluzinieren nicht nur bei Fakten; sie halluzinieren auch bei der Selbsteinschätzung. Ein Agent wird sich schwer tun, in ein Audit-Protokoll zu schreiben: „Es hat nicht funktioniert.” Stattdessen formuliert er: „Eigentlich habe ich meinen Job ganz gut gemacht.” Das ist für regulierte Umgebungen untragbar.


Das Silo-Problem: Warum Governance an Daten scheitert

Das Zielbild: Schnelle Releases plus nachvollziehbare KI

Das eigentliche Problem ist älter als KI. Viele Organisationen arbeiten nach wie vor in operativen Silos: Entwicklung in Jira/GitLab, Test in spezialisierten Test-Management-Tools, Operations in ServiceNow. DevOps versucht seit 20 Jahren, diese Mauern einzureißen. Auf der Team-Ebene ist das oft gelungen, aber die Daten bleiben isoliert.

Wenn man auf diese isolierten Daten eine KI loslässt, lernt sie genau das: Isolation. Keine Traceability, keine Breadcrumbs von der Business-Anforderung über Entwicklung und Test bis zur Produktion. Und ohne Traceability keine Auditierbarkeit, erst recht nicht, wenn ein autonomer Agent die Entscheidung getroffen hat.


Release-Risk-Gates: KI-Governance in der Praxis

Zieger zeigte ein konkretes Architekturbeispiel: ein vollautomatisiertes Release-Risikogate mit Human-in-the-Loop. Der Ansatz:

  1. Risikoschwelle definieren: je nach Kritikalität des Systems. E-Commerce mit Katzenfutter? Vielleicht 60 %. Medizintechnik oder Luftfahrt? Unter 5 %.
  2. KI bewertet das Release-Risiko: z.B. „72 % Wahrscheinlichkeit, dass es fehlschlägt. 15 fehlgeschlagene Tests im Payment-Modul.”
  3. Transparenz des Modells: Welches Modell wurde verwendet? Mit welcher Konfidenz?
  4. Traceability: Welches Release, welche Code Changes, welche Tickets? Die gesamte Lieferkette wird sichtbar.
  5. Menschliche Entscheidung: Freigeben, zurückstellen, oder dem Modell Feedback geben, damit es lernt.

Der kontinuierliche Lernzyklus: Produktionserfahrungen fließen automatisch in Teststrategien ein

Das Besondere: Die Architektur orchestriert nicht nur Tools und Menschen, sondern auch Agenten. Zieger verwies auf das „Periodensystem der DevOps-Tools”, und machte klar: Jeder dieser Tool-Hersteller bringt jetzt auch einen KI-Agenten mit. Die Orchestrierung wird dadurch eine Größenordnung komplexer.


Lessons Learned aus regulierten Umgebungen

Ziegers Fazit war pragmatisch und klar:

  • Vollständige Autonomie ist ein Managementtraum, keine Realität. Die Aufgaben ändern sich, aber Menschen bleiben unverzichtbar.
  • Human-in-the-Loop an definierten Kontrollpunkten ist nicht optional, sondern Pflicht.
  • Das Modell lernt: aber nur, wenn es strukturiertes Feedback von Experten bekommt.
  • Datenqualität ist der Katalysator: KI beschleunigt gute Ergebnisse und schlechte. Wer auf schlechte Datenqualität KI setzt, bekommt schneller schlechte Ergebnisse.

„Viele träumen davon, dass KI ihre nicht optimalen Prozesse wegoptimieren kann. Das wird nicht passieren. Was passieren wird: KI wird schneller zeigen, wie gut die Datenqualität im Software-Lieferprozess wirklich ist.”


Was bedeutet das für Ihr Team?

Der Mind-Shift, den Zieger fordert, betrifft sowohl Führung als auch Architektur: Nicht noch mehr Automatisierung, sondern erklärbare Automatisierung. Eine KI-Governance, eingebettet in eine Plattform- und Compliance-Strategie. Und die ehrliche Erkenntnis, dass die größte Hürde nicht die KI ist, sondern die Datensilos, die seit Jahrzehnten gewachsen sind.


Über den Speaker

Matthias Zieger ist Field CTO international bei Curiosity Software. Mit 30 Jahren Industrieerfahrung und 27 Jahren im Testautomation-Business verbindet er die Perspektive des Praktikers mit strategischer Vision.



Basierend auf dem Vortrag „Von Testdaten zu Vertrauen – Wie KI Governance im Software-Lifecycle Realität wird” am Swiss Testing Day 2026 in Zürich (Room 6, 10:00–10:30). Konferenzmotto: „Defining Quality in a Dangerous Decade”.

Swiss Testing Day — die führende Konferenz für Software-Qualität in der Schweiz.

From Test Data to Trust: How AI Governance Becomes Reality in the Software Lifecycle

Beyond Execution: Human Oversight and Trust in AI-Enhanced Testing

Swiss Testing Day 2027: Proof, Not Promises