Een Genie-agent testen en bewaken

Test een Genie Agent met echte vragen, bekijk de gegenereerde SQL en visualisaties, bewerk antwoorden wanneer Genie iets mis krijgt en controleer het gebruik van agents en gebruikersfeedback, zodat u de agent nauwkeurig kunt houden naarmate gegevens en vragen zich ontwikkelen. Gebruik benchmarks om de nauwkeurigheid van reacties op schaal te beoordelen.

Note

Genie Agenten werden voorheen Genie Spaces genoemd.

Test uw Genie Agent

De meeste gebruikersinteracties vinden plaats in het chatvenster. De beste manier om te leren of uw agent werkt zoals u wilt, is het testen met realistische vragen die uw zakelijke gebruikers verwachten.

Het chatvenster Genie met voorbeeldvragen en een tekstveld voor het invoeren van uw eigen vraag.

Voorbeeldvragen die zijn geconfigureerd in de agentinstellingen worden weergegeven in het chatvenster. Genie kan ook voorbeeldvragen genereren op basis van de context van de agent om gebruikers te helpen de gegevens te verkennen. Gebruikers kunnen op een voorbeeldvraag klikken of hun eigen vragen invoeren in het tekstveld onder aan het scherm.

Antwoorden worden boven het tekstveld weergegeven. Nadat een gebruiker een vraag heeft ingevoerd, wordt deze opgeslagen in de chatgeschiedenis.

Een nieuw gesprek starten:

  1. Klik op Nieuw chatgesprek om een nieuwe chat te starten. Klik op het pictogram geschiedenis om een eerder gesprek te openen.
  2. Typ uw vraag in het Stel uw vraag... tekstinvoerveld.

Antwoorden controleren

Antwoorden worden meestal geleverd als antwoorden in natuurlijke taal op de vragen en een tabel met de relevante resultatenset. Wanneer Genie detecteert dat een visualisatie de helderheid van de reactie kan verbeteren, wordt er ook een visualisatie geretourneerd. De precieze antwoordstructuur varieert op basis van de vraag. Als er een SQL-query is gegenereerd om de vraag te beantwoorden, wordt deze opgenomen in het antwoord.

Er wordt een voorbeeldantwoord weergegeven met visualisatie, feedback en andere opties.

Note

Net als andere grote taalmodellen (LLM's) kan Genie niet-deterministisch gedrag vertonen. Dit betekent dat u af en toe verschillende uitvoer ontvangt wanneer u dezelfde prompt meerdere keren indient. Het bieden van voorbeeld-SQL-query's waaruit Genie kan leren, kan helpen genie consistenter te maken. Zie Voorbeeld van SQL-query's en -functies toevoegen.

Feedback op antwoord

Elke reactie vraagt de gebruiker om te antwoorden Is dit juist? Gebruikers kunnen op een van de volgende manieren reageren:

  • Ja: Bevestigt dat het antwoord nauwkeurig wordt weergegeven.
  • Los dit probleem op: Markeert het antwoord als onjuist. Gebruikers kunnen kiezen uit veelvoorkomende problemen of hun eigen uitleg invoeren. Ze kunnen dan:
    • Klik op Verzenden en probeer het antwoord opnieuw te genereren met behulp van de opgegeven feedback.
    • Klik op Verzenden om de feedback te verzenden zonder het antwoord opnieuw te genereren.
  • Beoordeling aanvragen: Markeert het antwoord voor manuele beoordeling. Gebruikers kunnen een optionele opmerking toevoegen om u extra context te geven.

Als editor kunt u feedback en gemarkeerde antwoorden bekijken in de Genie-interface. Het gedrag van uw Genie Agent verandert niet alleen op basis van feedback van gebruikers. U moet feedback gebruiken om verbeterkansen te identificeren of rechtstreeks te reageren op vragen van gebruikers. Databricks raadt gebruikers aan om feedback te geven over de agent met behulp van dit mechanisme.

Zakelijke gebruikers kunnen updates bekijken van de vragen die ze hebben gemarkeerd voor controle op hun monitorpagina . Gebruikers met ten minste CAN MANAGE-machtigingen voor de Genie-agent kunnen de specifieke uitwisseling controleren, opmerkingen bij de aanvraag plaatsen en het antwoord bevestigen of corrigeren. Ze hebben toegang tot feedback en beoordelingsaanvragen op de controlepagina. Vervolgens kunt u die feedback gebruiken om antwoorden af te stemmen en uw agent iteratief te verbeteren. Zie De agent bewaken.

Andere antwoordacties

Voor antwoorden met gegenereerde SQL kunt u met aanvullende opties communiceren met de geretourneerde gegevens.

  • CSV kopiëren: Gebruikers van agents kunnen maximaal 1 GB aan resultatengegevens downloaden als CSV. De uiteindelijke downloadgrootte van het bestand kan iets meer of minder dan 1 GB zijn, omdat de limiet van 1 GB wordt toegepast op een eerdere stap dan het uiteindelijke downloaden van het bestand. Als u resultaten wilt downloaden, klikt u op het downloadpictogram in het antwoord.

  • Code weergeven: Klik op Code weergeven om de gegenereerde query weer te geven. Dit kan handig zijn voor het oplossen van onbetrouwbare antwoorden. Zie Query's bewerken en opslaan.

  • Het Kebab-menu pictogram. kebabmenu: Toegang tot de volgende acties:

    • CSV kopiëren: kopieer het antwoord-CSV naar het klembord.
    • Toevoegen als instructie: Klik op Toevoegen als instructie voor interacties die nuttig kunnen zijn voor het leren van Genie om vergelijkbare vragen te beantwoorden. Hiermee opent u de gebruikersinterface voor het opslaan van voorbeeld-SQL-query's, gevuld met de vraag en gegenereerde SQL. U kunt het voorbeeld als geschreven laten of bewerken en opslaan om wijzigingen aan te brengen. Zie Voorbeeld van SQL-query's en -functies toevoegen.
    • Toevoegen als benchmark: Voeg de vraag toe als een benchmarkvraag. Zie Benchmarks.
    • Gegevens vernieuwen: vernieuw de gegevens door de eerder gegenereerde query uit te voeren.
    • Antwoord opnieuw genereren: dien de vraag opnieuw in en laat Genie het antwoord opnieuw genereren.

Query's bewerken en opslaan

Sql-query's van Genie kunnen indien nodig worden gecontroleerd op nauwkeurigheid en bewerkt. Auteurs van genieagenten kennen doorgaans het domein en de gegevens waarmee ze kunnen herkennen wanneer Genie een onjuist antwoord genereert. Vaak kunnen fouten worden opgelost met een kleine hoeveelheid handmatige afstemming op de gegenereerde SQL-query. Klik op Gegenereerde code weergeven om de query te controleren en de gegenereerde SQL voor elk antwoord weer te geven.

U kunt de gegenereerde SQL-instructie bewerken om deze te corrigeren als u op de Genie Agent de machtiging CAN EDIT of hoger hebt. Nadat u de correcties hebt aangebracht, voert u de query uit. Vervolgens kunt u het opslaan als instructie om Genie te leren hoe u in de toekomst antwoordt. Als u de bewerkte query wilt opslaan, klikt u op Toevoegen als instructie.

Fouten opsporen in reacties met Genie Code

Wanneer Genie een onjuist antwoord retourneert, gebruikt u Genie Code om het probleem te diagnosticeren en de context van de agent te verbeteren:

  1. Open Genie Code vanuit het antwoord.
  2. Beschrijf het probleem en het gewenste gedrag.
  3. Bekijk de contextwijzigingen die Genie Code voorstelt en accepteer de wijzigingen die u wilt behouden.

Tip

Laat Genie Code dit voor u doen:

The Genie Agent is using calendar quarters instead of our fiscal calendar. Update its context to use our fiscal quarters: Q1 is February through April, Q2 is May through July, Q3 is August through October, and Q4 is November through January.

U kunt Genie Code ook gebruiken om semantische context op te slaan vanuit een gesprek. Nadat gebruikers nieuwe termen hebben geïntroduceerd of het gedrag van Genie hebben gecorrigeerd, vraagt u Genie Code om vast te leggen wat het heeft geleerd. Bekijk elke suggestie en accepteer de context die u aan de agent wilt toevoegen.

De agent bewaken

Een Genie Agent kan worden beschouwd als een hulpprogramma voor langdurige samenwerking tussen gegevensteams en zakelijke gebruikers. Het verzamelt kennis in de loop van de tijd in plaats van als een eenmalige implementatie. Wanneer gebruikers nieuwe vragen stellen, kunt u de agent verfijnen om de dekking en nauwkeurigheid te verbeteren.

Gebruik het tabblad Controleren om afzonderlijke vragen en antwoorden te bekijken, feedback van gebruikers weer te geven en antwoorden te identificeren die zijn gemarkeerd voor beoordeling.

Het tabblad Controleren met een lijst met vragen en antwoorden met filters voor tijd, beoordeling, gebruiker en status.

Op het tabblad Monitor worden alle vragen en antwoorden weergegeven die binnen de agent zijn gesteld. U kunt vragen filteren op tijd, beoordeling, gebruiker of status. Door de agent te bewaken, kunnen gebruikers met CAN MANAGE-machtigingen proactief inzicht krijgen in de query's die worden gegenereerd door zakelijke gebruikers en hoe de Genie Agent heeft gereageerd.

Het identificeren van de vragen waarmee Genie worstelt, kan u helpen de Genie-agent bij te werken met specifieke instructies om de reacties te verbeteren. Klik op een vraag om de tekst van de vraag en het antwoord te openen en de volledige chatthread weer te geven.

Gebruik de sectie Wekelijkse samenvatting van het tabblad Monitor om het wekelijkse berichtvolume, actieve gebruikers en duimen omhoog/omlaag te bekijken. Als u de belangrijkste gebruikstrends en veelvoorkomende problemen wilt identificeren, klikt u op Ruimtegebruik analyseren. Hiermee start Genie Code, waarmee de gebruikersberichten, feedback en problemen van de afgelopen zeven dagen en rapporten over veelvoorkomende onderwerpen, terugkerende problemen en voorgestelde contextverbeteringen worden beoordeeld. Antwoorden bevatten bronvermeldingen die teruggaan naar de relevante gesprekken in uw agent. Klik op een bronvermelding om het gesprek rechtstreeks in de Genie Code-thread te openen.

De sectie Wekelijks overzicht van het tabblad Bewaking met wekelijkse berichten, gebruikers en feedback.

Gesprekken controleren op kwaliteit

Important

Deze functie bevindt zich in de bètaversie. Als u deze wilt gebruiken, moet een werkruimtebeheerder Genie Chat delen inschakelen vanaf de pagina Previews . Zie Azure Databricks previews beheren.

Met Genie Chat Sharing kunnen agentmanagers de volledige gesprekken bekijken die zakelijke gebruikers hebben met een Genie-agent. Wanneer een gesprek is ingesteld op Controleerbaar door ruimtebeheerders, kunnen gebruikers met de machtiging CAN MANAGE het gesprek openen vanaf het tabblad Bewaking om de volledige uitwisseling te bekijken. Hiermee kunt u de responskwaliteit van Genie beoordelen, reageren op feedback van gebruikers en gebieden identificeren waar aanvullende instructies of voorbeeldquery's de nauwkeurigheid verbeteren. Voor gesprekken die zijn ingesteld op Privé, kunnen agentbeheerders gebruikersprompts zien op het tabblad Bewaking, maar kunnen ze het volledige gesprek of de volledige resultaten niet bekijken. Zie Een gesprek delen voor meer informatie.

Note

Gesprekken die zijn gemaakt voordat de bètaversie was ingeschakeld, blijven privé. Gesprekken die zijn gemaakt nadat deze functie is ingeschakeld, kunnen standaard worden beoordeeld door ruimtebeheerders.

Een gesprek verwijderen

Gebruikers met de toestemming CAN MANAGE op een Genie Agent kunnen vanaf de bewakingspagina elk gesprek van de agent permanent verwijderen. Hiermee verwijdert u het gesprek en de bijbehorende berichten voor alle gebruikers.

  1. Open de Genie Agent en klik op het tabblad Monitor .
  2. Klik op een gesprek om het gesprekspaneel te openen.
  3. Klik op Gesprek verwijderen.
  4. Klik in het bevestigingsvenster op Verwijderen om het gesprek definitief te verwijderen of op Annuleren om het dialoogvenster te sluiten zonder het te verwijderen.

Benchmarks

Met benchmarks kunt u een set testvragen maken die u kunt uitvoeren om de algehele reactienauwkeurigheid van Genie te beoordelen. Een goed ontworpen reeks benchmarks die betrekking hebben op de meest gestelde vragen van gebruikers, helpt bij het evalueren van de nauwkeurigheid van uw Genie Agent terwijl u deze verfijnt. Elke Genie Agent kan maximaal 500 benchmarkvragen bevatten.

Benchmarkvragen worden als nieuwe gesprekken uitgevoerd. Ze hebben niet dezelfde context als een gestructureerd Genie-gesprek. Elke vraag wordt verwerkt als een nieuwe query, met behulp van de instructies die zijn gedefinieerd in de agent, inclusief eventuele voorbeelden van SQL- en SQL-functies.

Benchmarkvragen ondersteunen twee modi:

  • Chatmodus: de standaardmodus. Genie beoordeelt de nauwkeurigheid door de door SQL gegenereerde resultaten te vergelijken met een opgegeven SQL-antwoord.
  • Agentmodus: voert benchmarkvragen uit met behulp van dezelfde redenering in meerdere stappen als de agentmodus van Genie. Een LLM-rechter beoordeelt de antwoorden. U kunt een optionele evaluatienotitie opgeven om beoordeling te begeleiden.

Je kiest de modus wanneer je benchmarks uitvoert, niet als je een vraag toevoegt. Gebruik de modusschakelaar rechtsboven in het tabblad Benchmarks om Chat of Agent-modus te kiezen voor een run. De geselecteerde modus geldt voor alle vragen in die run.

Voorbeeldbenchmarks met de nauwkeurigheid zoals gerapporteerd over negen vragen.

Benchmarkvragen toevoegen

Benchmarkvragen moeten verschillende manieren weerspiegelen om de veelgestelde vragen te formuleren die uw gebruikers stellen. U kunt deze gebruiken om het antwoord van Genie te controleren op variaties in de formulering van vragen of verschillende vraagindelingen.

Wanneer u een benchmarkvraag maakt, kunt u desgewenst een SQL-query opnemen waarvan de resultatenset het juiste antwoord is. Tijdens benchmarkuitvoeringen wordt de nauwkeurigheid beoordeeld door de resultatenset van uw SQL-query te vergelijken met de set die door Genie wordt gegenereerd. U kunt Unity Catalog SQL-functies ook gebruiken als goudstandaardantwoorden voor benchmarks.

Een benchmarkvraag toevoegen:

  1. Klik bovenaan de Genie Agent op Benchmarks.

  2. Klik op Benchmark toevoegen.

  3. Voer in het veld Vraag een benchmarkvraag in die u wilt testen.

  4. (Optioneel) Geef een SQL-query op waarmee de vraag wordt beantwoord. U kunt uw eigen query schrijven door te typen in het vak SQL Answer , inclusief Unity Catalog SQL-functies. U kunt ook op SQL genereren klikken om Genie de SQL-query voor u te laten schrijven. Gebruik een SQL-instructie waarmee de vraag die u hebt ingevoerd nauwkeurig wordt beantwoord.

    Note

    Deze stap wordt aanbevolen voor Chat-modus runs. Alleen vragen die deze SQL-voorbeeldinstructie bevatten, kunnen automatisch worden beoordeeld op nauwkeurigheid. Voor vragen die geen SQL Answer bevatten, is handmatige beoordeling noodzakelijk voor een score. Als u de knop SQL genereren gebruikt, controleert u de instructie om er zeker van te zijn dat deze de vraag nauwkeurig beantwoordt.

  5. (Optioneel) Voer in het veld 'Evaluatienotitie ' richtlijnen in over het juiste antwoord of de verwachte inhoud. Tijdens Agent-modus runs geeft Genie de evaluatienotitie door aan de LLM-jury. De notitie kan verwijzen naar verwachte inhoud in tekstrapporten die door de agentmodus worden gegenereerd.

  6. (Optioneel) Klik op uitvoeren om uw query uit te voeren en de resultaten weer te geven.

  7. Wanneer u klaar bent met bewerken, klikt u op Benchmark toevoegen.

  8. Als u een vraag wilt bijwerken nadat u deze hebt opgeslagen, klikt u op het pictogram Bewerken potloodpictogram om het dialoogvenster Vraag bijwerken te openen.

Benchmarks gebruiken om alternatieve formuleringen met vragen te testen

Bij het evalueren van de nauwkeurigheid van uw Genie Agent is het belangrijk om tests te structuren om realistische scenario's weer te geven. Gebruikers kunnen op verschillende manieren dezelfde vraag stellen. Databricks raadt aan om meerdere formuleringen van dezelfde vraag toe te voegen en hetzelfde voorbeeld van SQL in uw benchmarktests te gebruiken om de nauwkeurigheid volledig te beoordelen. De meeste Genie-agenten moeten tussen twee en vier formuleringen van dezelfde vraag bevatten.

Benchmarkvragen uitvoeren

Gebruikers met ten minste CAN EDIT-machtigingen in een Genie Agent kunnen op elk gewenst moment een benchmark-evaluatie uitvoeren. U kunt alle benchmarkvragen uitvoeren of een subset vragen selecteren die u wilt testen.

Voor elke vraag interpreteert Genie de invoer, genereert SQL en retourneert het resultaat. De gegenereerde SQL en resultaten worden vervolgens vergeleken met het SQL-antwoord dat is gedefinieerd in de benchmarkvraag.

Om alle benchmarkvragen uit te voeren

  1. Klik bovenaan de Genie Agent op Benchmarks.
  2. Klik op Benchmarks uitvoeren om de testuitvoering te starten.

Een subset van benchmarkvragen uitvoeren:

  1. Klik bovenaan de Genie Agent op Benchmarks.
  2. Schakel de selectievakjes in naast de vragen die u wilt testen.
  3. Klik op Uitvoeren geselecteerd om de testuitvoering te starten op de geselecteerde vragen.

U kunt ook een subset met vragen selecteren uit een vorig benchmarkresultaat en deze specifieke vragen opnieuw uitvoeren om verbeteringen te testen.

Benchmarks blijven actief wanneer u van de pagina navigeert. U kunt de resultaten controleren op het tabblad Evaluatie wanneer de uitvoering is voltooid.

Nadat een uitvoering is voltooid, kunt u Genie Code gebruiken om de resultaten in de hele uitvoering te bekijken en contextverbeteringen voor te stellen. Zie Een benchmarkuitvoering analyseren met Genie Code.

Classificaties van chatmodus

De volgende criteria bepalen hoe Genie chatmodusreacties tarieven:

Condition Kwalificatie
Genie genereert SQL die exact overeenkomt met het opgegeven SQL-antwoord Goed
Genie genereert een resultatenset die exact overeenkomt met de resultatenset die wordt geproduceerd door sql Answer Goed
Genie genereert een resultatenset met dezelfde gegevens als sql Answer , maar anders gesorteerd Goed
Genie genereert een resultatenset met numerieke waarden die worden afgerond op dezelfde vier significante cijfers als het SQL-antwoord Goed
Genie genereert SQL die een lege resultatenset produceert of een fout retourneert Slecht
Genie genereert een resultatenset die extra kolommen bevat vergeleken met de resultatenset die wordt geproduceerd door sql Answer Slecht
Genie genereert één celresultaat dat verschilt van het resultaat van één cel dat wordt geproduceerd door het SQL Answer Slecht

Note

De chatmodus vergelijkt tot 5.000 rijen van elke resultaatset. Wanneer een resultaatset meer dan 5.000 rijen bedraagt en de rijvolgorde verschilt tussen de door de Genie gegenereerde resultaten en het SQL-antwoord, kan deze afkap ervoor zorgen dat een overeenkomende resultaatset als Slecht wordt beoordeeld. Om dit te voorkomen, schrijf SQL Answer-queries die minder dan 5.000 rijen teruggeven, of voeg een ORDER BY clausule toe aan zowel het SQL Answer als de verwachte Genie-uitvoer zodat de rijvolgorde consistent blijft.

Wanneer een resultaat als Slecht wordt beoordeeld, geeft de verklaring het type mismatch aan.

Handmatige controle nodig: antwoorden worden gemarkeerd met dit label wanneer Genie de juistheid niet kan beoordelen of wanneer door Genie gegenereerde queryresultaten geen exacte overeenkomst bevatten met de resultaten van het opgegeven SQL-antwoord. Benchmarkvragen die geen SQL Answer bevatten, moeten handmatig worden gecontroleerd.

Classificaties van agentmodus

Een LLM als beoordelaar beoordeelt antwoorden in de agentmodus in plaats van een SQL-vergelijking te gebruiken. Als u een evaluatienotitie hebt opgegeven, gebruikt de LLM-rechter deze als richtlijn bij het beoordelen van het antwoord, inclusief alle verwachte inhoud in het tekstrapport dat door de agentmodus wordt gegenereerd. De rechter beoordeelt antwoorden die voldoen aan de beoordelingsnotitiecriteria als Goed.

Evaluaties van Access-benchmark

U hebt toegang tot al uw benchmark-evaluaties om de nauwkeurigheid in uw Genie Agent in de loop van de tijd bij te houden. Wanneer u de Benchmarks van een agent opent, wordt er een tijdstempellijst met evaluatieuitvoeringen weergegeven op het tabblad Evaluaties . Als er geen evaluatieuitvoeringen worden gevonden, raadpleegt u Benchmarkvragen toevoegen of Benchmarkvragen uitvoeren.

Evaluatiescherm zoals wordt beschreven in de volgende tekst.

Op het tabblad Evaluaties ziet u een overzicht van de evaluaties en de prestaties die in de volgende categorieën zijn gerapporteerd:

Evaluatienaam: een tijdstempel die aangeeft wanneer een evaluatieuitvoering heeft plaatsgevonden. Klik op de tijdstempel om details voor die evaluatie weer te geven. Uitvoeringsstatus: Geeft aan of de evaluatie is voltooid, onderbroken of mislukt. Als een evaluatieuitvoering benchmarkvragen bevat die geen vooraf gedefinieerde SQL-antwoorden hebben, wordt deze gemarkeerd voor beoordeling in deze kolom. Nauwkeurigheid: Een numerieke beoordeling van nauwkeurigheid in alle benchmarkvragen. Voor evaluatieuitvoeringen waarvoor handmatige controle is vereist, wordt er pas een nauwkeurigheidsmeting weergegeven nadat deze vragen zijn beoordeeld. Gemaakt door: Geeft de naam aan van de gebruiker die de evaluatie heeft uitgevoerd.

Afzonderlijke evaluaties bekijken

U kunt afzonderlijke evaluaties bekijken om elk antwoord gedetailleerd te bekijken. U kunt de evaluatie bewerken voor elke vraag en alle items bijwerken die handmatig moeten worden gecontroleerd.

Afzonderlijke evaluaties bekijken:

  1. Klik bovenaan de Genie Agent op Benchmark.

  2. Klik op de tijdstempel voor een evaluatie in de kolom Evaluatienaam om een gedetailleerde weergave van die testuitvoering te openen.

    Een scherm met de resultaten van één evaluatieuitvoering. Alle vragen worden aan de linkerkant weergegeven. Indien van toepassing, worden afzonderlijke vragen aan de rechterkant weergegeven met de modeluitvoer en de uitvoer van de grondwaar.

  3. Gebruik de lijst met vragen aan de linkerkant van het scherm om een gedetailleerde weergave van elke vraag te bekijken.

  4. Controleer en vergelijk het uitvoerantwoord van het model met het antwoord Ground truth.

    Voor resultaten die als onjuist zijn beoordeeld, wordt een uitleg weergegeven waarin wordt beschreven waarom het resultaat als Ongeldig is beoordeeld. Dit helpt u specifieke verschillen te begrijpen tussen de gegenereerde uitvoer en de verwachte werkelijkheidswaarde.

    Note

    De resultaten van deze antwoorden worden één week weergegeven in de evaluatiedetails. Na een week zijn de resultaten niet meer zichtbaar. De gegenereerde SQL-instructie en de voorbeeld-SQL-instructie blijven behouden.

  5. Klik op Grondwaar bijwerken om het antwoord op te slaan als de nieuwe Grondwaar voor deze vraag. Dit is handig als er geen grondwaar bestaat, of als het antwoord beter of nauwkeuriger is dan de bestaande grondwaarverklaring.

  6. Klik op het Pictogram Bewerken label om de evaluatie te bewerken.

    Markeer elk resultaat als Good of Bad om een nauwkeurige score voor deze evaluatie te krijgen.

Een benchmarkuitvoering analyseren met Genie Code

Nadat een benchmarkuitvoering is voltooid, gebruikt u Genie Code om de resultaten in de hele uitvoering te bekijken in plaats van elke vraag afzonderlijk te inspecteren. Start Genie Code vanuit de evaluatie en vraag het om de uitvoering te analyseren. Genie Code bekijkt de verwachte resultaten, wat uw agent heeft gegenereerd en de huidige context van de agent om hiaten te vinden, en stelt vervolgens instructies en contextverbeteringen voor u voor om te controleren en op te slaan.