Beyond Execution: Human Oversight and Trust in AI-Enhanced Testing

Speaker: Ezgi Berberoglu (SW Engineer in Test) | Swiss Testing Day 2026 | Room 5, 10:00

Key Takeaways

  1. Trust, not speed, is the central problem—AI can be both convincing and wrong at the same time. Without an evidence gate, plausible suggestions become risky actions.
  2. Deterministic policy gates before AI recommendations—A rule-based gate decides, based on risk levels, whether the AI is allowed to act before an AI recommendation is even generated.
  3. Structured evidence dramatically improves AI quality—useful advice increases from 35% to 53%, and unsubstantiated claims decrease from 21% to 4% when processed evidence records are used instead of raw CI logs.

  1.   

Making AI Advice Trustworthy in Test Failure Triage

Picture this: a test fails, and AI suggests “Likely flaky — quarantine the test to unblock CI.” Sounds plausible, turns the pipeline green — but does it solve the problem? At Swiss Testing Day 2026, Ezgi Berberoglu, SW Engineer in Test, presented a systematic approach to answering exactly this question.


The Core Problem: Trust Over Speed

“I’m not really interested in how to speed up execution, but rather making decisions around failures trustworthy.”

AI can help enormously with failure analysis — clustering failures, suggesting next steps, summarizing results. But faster output does not automatically mean safer decisions. The real risk: AI can be confident and wrong at the same time. Under time pressure, teams accept AI suggestions, the pipeline goes green — but the root cause stays hidden.

Berberoglu frames this as “speed with drift” versus “speed with accountability.” Without a systematic check, plausible AI advice becomes risky action.

The key question of trust: It sounds plausible—but can we prove it? Who is responsible?

 

The Solution: A Deterministic Policy Gate

The approach places AI deliberately last in a three-stage pipeline:

  1. Extract evidence anchors — From failing CI logs, systematically extract test names, error types, error messages, and failure scope using deterministic rules (regex, pattern matching).
  2. The gate decides — Rule-based, no AI involved. Based on evidence quality and failure signals, a risk level is assigned (Low, Medium, High).
  3. AI advises — Only then does AI receive the structured evidence records (not raw logs!) and provide a bounded proposal attached to the audit trace.

 

The pipeline: Evidence Anchors → Policy Gate → Bounded AI Advice. The gate decision is policy-driven and exists independently of AI.


“The gate decision is policy-driven and exists without AI. AI is there just as an advisor, attached alongside the decision.”

 

Risk Tiers Control AI Autonomy

    • Low risk: Clear assertion failure, test identified, narrow scope. AI may assist (group, summarize, route tickets). No human review needed.

    • Medium risk: Incomplete evidence (e.g., timeout with external dependency). AI may suggest, but human review is required.

    • High risk: Missing evidence (e.g., build error without test name). AI proposals are logged, but action requires human approval.

The backbone remains constant across all tiers: explicit evidence, traceable decisions, clear ownership.


The Numbers

Berberoglu validated her approach using the public BugSwarm dataset (100 reproducible CI failure/passing pairs). The critical experiment: same AI model, different input format.

Left: Useful advice increases from 35% to 53%. Right: Unsubstantiated claims decrease from 21% to 4%.

 

Metric Raw CI Logs Evidence Records
Useful advice rate 35% 53%
Unsupported claim rate 21% 4%

Simply changing the input format — structured evidence records instead of raw logs — substantially improves AI quality. Raw CI logs are messy and incomplete, causing AI to “invent” information. Structured records constrain the decision space and include the gate’s risk-level context.


Challenges and Next Steps

    • Messy logs: Extraction can fail — but missing evidence automatically triggers high risk and human review.

    • No universal gate rules: Risk is product- and team-specific; rules need customization.

    • Privacy: Even evidence bundles contain company data, though less than raw logs.

    • Next step: A feedback loop with reviewer labels to measure whether AI suggestions actually lead to correct fixes.

 

Bottom Line

The approach is refreshingly pragmatic: not an AI revolution, but a classic quality management principle — evidence before action — applied to AI-assisted test analysis. The gate does not make AI obsolete; it makes AI trustworthy.


Über die Ausführung hinaus: Menschliche Überprüfung und Vertrauen in KI-gestützte Tests

 

Speaker: Ezgi Berberoglu (SW Engineer in Test) | Swiss Testing Day 2026 | Room 5, 10:00

Key Takeaways

  1. Trust, nicht Speed, ist das zentrale Problem — KI kann gleichzeitig überzeugend und falsch sein. Ohne Evidenz-Gate werden plausible Vorschläge zu riskanten Aktionen.
  2. Deterministische Policy Gates vor KI-Ratschlägen — Ein regelbasiertes Gate entscheidet anhand von Risiko-Stufen, ob KI handeln darf, bevor überhaupt ein KI-Vorschlag generiert wird.
  3. Strukturierte Evidenz verbessert KI-Qualität dramatisch — Nützliche Ratschläge steigen von 35 % auf 53 %, unbelegte Behauptungen sinken von 21 % auf 4 %, wenn statt roher CI-Logs aufbereitete Evidence Records verwendet werden.

  1.  

Wenn KI-Vorschläge vertrauenswürdig werden sollen

Stellen Sie sich vor: Ein Test schlägt fehl, und die KI schlägt vor: “Wahrscheinlich flaky — quarantäne den Test, um die CI-Pipeline zu entsperren.” Klingt plausibel, macht die Pipeline grün — aber löst es das Problem? Ezgi Berberoglu, SW Engineer in Test, stellte am Swiss Testing Day 2026 einen Ansatz vor, der genau diese Frage systematisch beantwortet.


Das Kernproblem: Vertrauen statt Geschwindigkeit

“Ich interessiere mich nicht primär dafür, wie man die Ausführung beschleunigt, sondern dafür, wie man Entscheidungen bei Fehlern vertrauenswürdig macht.”

KI kann bei der Fehleranalyse enorm helfen — beim Clustern von Failures, beim Vorschlagen nächster Schritte, beim Zusammenfassen von Ergebnissen. Aber schnellere Ausgabe bedeutet nicht automatisch sicherere Entscheidungen. Das eigentliche Risiko: KI kann überzeugend und gleichzeitig falsch sein. Unter Zeitdruck nehmen Teams den KI-Vorschlag an, die Pipeline wird grün — aber die Ursache bleibt verborgen.


Die zentrale Vertrauensfrage: Klingt plausibel — aber können wir es belegen? Wer ist verantwortlich?

 

Die Lösung: Ein deterministisches Policy Gate

Berberoglu schlägt ein dreistufiges System vor, bei dem die KI bewusst an letzter Stelle steht:

  1. Evidence Anchors extrahieren — Aus den fehlgeschlagenen CI-Logs werden strukturiert Testname, Fehlertyp, Fehlermeldungen und Scope extrahiert.
  2. Das Gate entscheidet — Regelbasiert, ohne KI-Beteiligung. Basierend auf der Evidenzqualität und Failure-Signalen wird ein Risiko-Level zugewiesen (Low, Medium, High).
  3. KI berät — Erst dann kommt die KI, erhält die aufbereiteten Evidence Records (nicht die rohen Logs!) und liefert einen gebundenen Vorschlag, der dem Trace beigefügt wird.

  1.  

Die Pipeline: Evidence Anchors → Policy Gate → Bounded AI Advice. Die Gate-Entscheidung ist policy-driven und existiert ohne KI.


“Die Gate-Entscheidung ist policy-getrieben und existiert ohne KI. KI ist nur als Berater dabei, angehängt an die Entscheidung.”


Risiko-Stufen bestimmen KI-Autonomie

Das Gate arbeitet mit drei Risiko-Stufen:

    • Low Risk: Klarer Assertion-Fehler, Test identifiziert, enger Scope. KI darf assistieren (gruppieren, zusammenfassen, Tickets routen). Kein Human Review nötig.

    • Medium Risk: Unvollständige Evidenz (z. B. Timeout mit externer Abhängigkeit). KI darf vorschlagen, aber Human Review ist erforderlich.

    • High Risk: Fehlende Evidenz (z. B. Build-Fehler ohne Testname). KI-Vorschläge werden protokolliert, aber Aktion erfordert menschliche Genehmigung.

Unabhängig von der Risiko-Stufe gilt immer: explizite Evidenz, nachvollziehbare Entscheidungen, klare Verantwortlichkeiten.


Die Zahlen sprechen für sich

Berberoglu validierte ihren Ansatz mit dem öffentlichen BugSwarm-Datensatz (100 reproduzierbare CI-Failure/Passing-Paare). Der entscheidende Test: gleiches KI-Modell, unterschiedlicher Input.

Links: Nützliche Ratschläge steigen von 35 % auf 53 %. Rechts: Unbelegte Behauptungen sinken von 21 % auf 4 %.

 

Metrik Rohe CI-Logs Evidence Records
Nützliche Ratschläge 35 % 53 %
Unbelegte Behauptungen 21 % 4 %

Allein durch die Änderung des Input-Formats — strukturierte Evidence Records statt roher Logs — verbessert sich die KI-Qualität erheblich. Die Erklärung: Rohe CI-Logs sind unübersichtlich und unvollständig, was KI dazu verleitet, Informationen zu “erfinden”. Strukturierte Records grenzen den Entscheidungsraum ein.

Herausforderungen und nächste Schritte

    • Unordentliche Logs: Extraktion kann scheitern — fehlende Evidenz führt aber automatisch zu High Risk und Human Review (“nichts Gefährliches”).

    • Keine universellen Gate-Regeln: Risiko ist produkt- und teamspezifisch. Die Regeln müssen angepasst werden.

    • Datenschutz: Auch Evidence Bundles enthalten Unternehmensdaten — aber weniger als rohe Logs.

    • Nächster Schritt: Feedback-Loop mit Reviewer-Labels, um zu messen, ob KI-Vorschläge tatsächlich zum Fix führen.
 

Fazit

Der Ansatz ist erfrischend pragmatisch: Keine KI-Revolution, sondern ein klassisches Qualitätsmanagement-Prinzip — Evidenz vor Aktion — angewandt auf KI-gestützte Testanalyse. Das Gate macht KI nicht überflüssig, sondern vertrauenswürdig.


Über die Speakerin

Ezgi Berberoglu ist SW Engineer in Test. Ihr Fokus liegt auf der Frage, wie KI-gestützte Entscheidungen in der Testanalyse vertrauenswürdig gemacht werden können — durch evidenzbasierte Policy Gates und strukturierte Informationsaufbereitung.


Swiss Testing Day 2026 — “Defining Quality in a Dangerous Decade” — StageOne, Zürich, 26. März 2026 Berichterstattung: Xebia

Beyond Execution: Human Oversight and Trust in AI-Enhanced Testing

Swiss Testing Day 2027: Proof, Not Promises

Test Automation at Scale: How MCP and Playwright Are Transforming Test Development