Remarque
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de vous connecter ou de modifier des répertoires.
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de modifier des répertoires.
Lorsque vous créez des ensembles de test, choisissez parmi différentes méthodes de test pour évaluer les réponses de votre assistant. Chaque méthode de test a ses propres points forts et est adaptée à différents types d’évaluations.
| Méthode de test | Mesures | Type de jeu de test | Scoring | Configurations |
|---|---|---|---|---|
| Qualité générale | Quelle est la qualité de la ou des réponses d’un cas de test en fonction de qualités spécifiques | Réponse unique ou conversation | Noté sur 100 % | Aucune |
| Comparer la signification | Dans quelle mesure le sens de la réponse du cas de test correspond à la réponse attendue | Réponse unique | Noté sur 100 % | Score de réussite, réponse attendue |
| Outil utilise | Si le cas de test a utilisé la totalité ou une partie des ressources attendues | Réponse unique | Réussite/échec | Capacités attendues |
| Correspondance de mot-clé | Si le cas de test a utilisé la totalité ou une partie des mots-clés ou expressions attendus | Réponse unique ou conversation | Réussite/échec | Mots-clés ou expressions attendus |
| Similarité du texte | Dans quelle mesure le texte de la réponse du cas de test correspond à la réponse attendue | Réponse unique | Noté sur 100 % | Score de réussite, réponse attendue |
| Correspondance exacte | Si la réponse du cas de test correspond exactement à la réponse attendue | Réponse unique | Réussite/échec | Réponses attendues |
| Personnalisée | Si la réponse du cas de test répond à vos critères ou attentes définis. | Réponse unique ou conversation | Réussite/échec (selon les critères définis par l’étiquette) | Nom, instructions d’évaluation, étiquettes |
Ajouter une méthode test
Lors de la création ou de la modification d’un ensemble de tests, sélectionnez Ajouter une méthode de test.
Sélectionnez toutes les méthodes que vous souhaitez tester, puis sélectionnez OK. Vous pouvez ajouter plusieurs méthodes.
Certaines méthodes exigent un score de réussite. Le score de réussite détermine quel score correspond à une réussite ou à un échec. Fixez le score, puis sélectionnez OK.
Certaines méthodes de test nécessitent des critères supplémentaires.
Cliquez sur l’icône Enregistrer pour enregistrer les modifications que vous avez apportées à l’ensemble de tests.
Sélectionnez une méthode de test existante pour modifier les critères de cette méthode ou supprimez-la.
Qualité générale
Disponible pour les ensembles de tests de réponses uniques et de conversation. Qualité générale vous aide à décider si les réponses de votre assistant répondent à vos standards. Il utilise un grand modèle de langage (LLM) pour évaluer l’efficacité avec laquelle un assistant répond aux questions des utilisateurs.
La qualité générale est particulièrement utile lorsqu’aucune réponse exacte n’est attendue. Il offre un moyen flexible et évolutif d’évaluer les réponses en fonction des documents récupérés et du déroulement de la conversation.
Il utilise ces critères clés et applique une requête cohérente pour guider la notation :
Pertinence : dans quelle mesure la réponse de l’assistant répond à la question. Par exemple, la réponse de l’assistant reste-t-elle sur le sujet et répond-elle directement à la question ?
Fondement : dans quelle mesure la réponse de l’assistant est basée sur le contexte fourni. Par exemple, la réponse de l’assistant se base-t-elle sur les informations fournies dans le contexte ou y fait-elle référence, plutôt que d’introduire des éléments sans rapport ou non étayés ?
Exhaustivité : dans quelle mesure la réponse de l’assistant fournit toutes les informations nécessaires. Par exemple, la réponse de l’assistant aborde-t-elle tous les aspects de la question et fournit-elle suffisamment de détails ?
Abstention : indique si l’assistant a tenté de répondre à la question ou non.
Pour être considérée comme de haute qualité, une réponse doit répondre à tous ces critères clés. Si l’une des conditions n’est pas remplie, la réponse est signalée pour amélioration. Cette méthode d’évaluation garantit que seules les réponses à la fois complètes et bien étayées obtiennent la note maximale. En revanche, les réponses incomplètes ou dépourvues de preuves à l’appui reçoivent des scores plus faibles.
Lorsque vous ajoutez ou modifiez des méthodes de test, sélectionnez Qualité générale. Tous les ensembles de tests commencent par défaut avec cette méthode.
Vous n’avez pas besoin d’ajouter les réponses attendues aux cas tests pour réaliser une évaluation générale de la qualité.
Note
La réduction du nombre de sources de connaissances pour l’assistant ne garantit pas une amélioration de la notation de la qualité générale lors de l’évaluation de l’assistant. Cette limitation existe parce que les connaissances récupérées (celles que le modèle considère comme pertinentes pour un cas de test spécifique) peuvent être trop volumineuses.
Comparer la signification
Disponible pour les ensembles de tests de réponses uniques. Compare le sens : évalue dans quelle mesure la réponse de l’assistant reflète le sens prévu de la réponse attendue. Au lieu de se concentrer sur une formulation exacte, elle utilise une similarité d’intention, ce qui signifie qu’elle compare les idées et la signification derrière les mots, pour juger de la manière dont la réponse s’aligne sur ce qui était attendu.
Comme pour la qualité générale, la méthode « Comparer la signification » est particulièrement utile lorsqu’il n’y a pas de réponse exacte attendue. Il offre un moyen flexible et évolutif d’évaluer les réponses en fonction des documents récupérés et du déroulement de la conversation.
Vous pouvez définir un seuil de réussite afin de déterminer ce qui constitue un score suffisant pour qu’une réponse soit considérée comme correcte. La note de passage par défaut est de 50. La méthode de test de comparaison du sens est utile lorsqu’une réponse peut être formulée de plusieurs manières correctes, mais que le sens ou l’intention générale doit tout de même être préservé(e).
Lorsque vous ajoutez ou modifiez des méthodes de test, sélectionnez Comparer le sens.
Fixez le score de réussite pour cette méthode.
Ajoutez les réponses attendues. Tout cas de test sans réponses attendues produit un résultat Non valide pour cette méthode de test.
Sélectionnez un cas de test
Ajoutez la réponse attendue.
Sélectionnez Appliquer pour enregistrer la réponse attendue.
Répétez pour tous les cas de test que vous souhaitez tester en utilisant cette méthode.
Outil utilise
Disponible pour les ensembles de tests de réponses uniques. Utilisation d’outils teste si l’assistant a utilisé des outils ou des rubriques spécifiques pour générer une réponse. Si c’est le cas, il réussit. Dans le cas contraire, le test échoue.
Lorsque vous ajoutez ou modifiez des méthodes de test, sélectionnez Utilisation d’outils.
Ajoutez les outils ou rubriques attendus. Tout cas de test sans réponses attendues produit un résultat Non valide pour cette méthode de test.
Sélectionnez un cas de test Pour ajouter les mêmes outils et rubriques attendus pour tous les cas de test, sélectionnez l’icône Modifier
dans l’en-tête de la colonne Outils.Dans le volet Sélection des outils, choisissez les rubriques ou outils que vous souhaitez que votre assistant utilise pour ce cas de test.
Cliquez sur OK.
Sélectionnez Enregistrer pour enregistrer les modifications.
Répétez l’opération pour tous les cas de test pour lesquels vous souhaitez tester l’utilisation des outils.
Correspondance de mot clé
Disponible pour les ensembles de tests de réponses uniques et de conversation. La correspondance par mot-clé vérifie si la réponse de l’assistant contient tout ou partie des mots ou expressions de la réponse attendue que vous définissez. Si c’est le cas, il réussit. Dans le cas contraire, le test échoue.
Vous pouvez sélectionner si la validation requiert Au moins un des mots-clés ou Tous les mots-clés. Choisir Au moins un signifie que si au moins un mot ou une phrase correspond, le cas de test réussit. Choisir Tous signifie que tous les mots ou expressions attendus doivent correspondre pour qu’un cas de test soit validé.
Lorsque vous ajoutez ou modifiez des méthodes de test, sélectionnez Correspondance des mots-clés.
Sélectionnez si un cas de test a besoin d’au moins un ou de tous les mots clés en correspondance.
Ajoutez les mots-clés attendus. Tout cas de test sans mots-clés attendus produit un résultat Non valide pour cette méthode de test.
Sélectionnez un cas de test
Dans le volet Modifier le cas de test, ajoutez un mot-clé ou une expression que vous attendez dans la réponse de ce cas.
Sélectionnez + Ajouter pour ajouter plus de mots-clés ou expressions. Pour supprimer un mot-clé ou une phrase, sélectionnez l’icône Supprimer
.Sélectionnez Appliquer pour enregistrer les mots-clés attendus.
Répétez l’opération pour tous les cas de test pour lesquels vous souhaitez tester la correspondance des mots-clés.
Similarité du texte
La méthode de similarité textuelle évalue la similarité entre les réponses de l’assistant et les réponses attendues que vous définissez dans votre ensemble de test. Ce mode de test s’utilise lorsque la réponse correcte doit correspondre exactement, ou presque, à la réponse attendue, tant sur le plan de la formulation que sur celui de la structure des phrases. Par exemple, une formulation précise est souvent nécessaire lors de la génération d’un document juridique. Ce test est généralement utilisé en complément de la méthode de test Comparer la signification, qui garantit la similarité du sens, mais pas celle de la formulation. Elle se distingue également de la méthode de test Correspondance des mots-clés, qui garantit la présence de certains termes, mais ne garantit pas la similarité de la construction. Si la réponse complète doit correspondre exactement à la réponse attendue intégrale, utilisez plutôt la méthode de test Correspondance exacte.
Une métrique de similarité cosinus évalue à quel point la réponse de l’assistant correspond à la formulation de la réponse attendue et détermine un score. Le score varie entre 0 et 1, 1 indiquant que la réponse correspond étroitement et 0 qu’elle ne correspond pas. Vous pouvez définir un seuil de réussite afin de déterminer ce qui constitue un score suffisant pour qu’une réponse soit considérée comme correcte.
Lorsque vous ajoutez ou modifiez des méthodes de test, sélectionnez Similarité de texte.
Fixez le score de réussite pour cette méthode.
Ajoutez les réponses attendues. Tout cas de test sans réponses attendues produit un résultat Non valide pour cette méthode de test.
Sélectionnez un cas de test
Ajoutez la réponse attendue.
Sélectionnez Appliquer pour enregistrer la réponse attendue.
Répétez pour tous les cas de test que vous souhaitez tester en utilisant cette méthode.
Correspondance exacte
Disponible pour les ensembles de tests de réponses uniques. La correspondance exacte vérifie si la réponse de l’assistant correspond exactement à la réponse attendue dans le test : caractère par caractère, mot pour mot. Si la réponse est identique, le test est réussi. Si quelque chose diffère, il échoue. La correspondance exacte est utile pour des réponses courtes et précises telles que des nombres, des codes ou des expressions toutes faites. Elle ne convient pas aux réponses qu’il est possible de formuler de plusieurs manières correctes.
Lorsque vous ajoutez ou modifiez des méthodes de test, sélectionnez Correspondance exacte.
Ajoutez les réponses attendues. Tout cas de test sans réponses attendues produit un résultat Non valide pour cette méthode de test.
Sélectionnez un cas de test
Ajoutez la réponse attendue.
Sélectionnez Appliquer pour enregistrer la réponse attendue.
Répétez pour tous les cas de test que vous souhaitez tester en utilisant cette méthode.
Personnalisé
Personnalisé est une méthode de test personnalisable. Cela vous permet de tester et d’étiquetter les réponses de l’assistant selon vos propres critères. Par exemple, vous pouvez créer un test de conformité pour qu’un agent RH étiquette les réponses du test comme conformes ou non conformes à votre description de la conformité RH.
Un test personnalisé comporte deux éléments à configurer :
Instructions d’évaluation : décrit l’objectif que vous souhaitez atteindre avec ce test. Que voulez-vous que le test évalue concernant les réponses de votre assistant ?
Les bonnes instructions d’évaluation devraient :
Soyez axé sur les objectifs.
N’utilisez que les caractères autorisés.
Utilisez des points à puces et des en-têtes pour l’organisation.
Par exemple :
Evaluate the agent's response for HR policy compliance.
What to check:
- Determine whether the answer protects privacy and avoids revealing or requesting sensitive data.
- Avoids discrimination, bias, or inappropriate judgments.
- Provides safe, neutral, HR-aligned guidance.
- Does not give legal advice or make definitive claims.
Étiquettes : décrit le résultat attribué à chaque réponse dans le cadre du test personnalisé. Les étiquettes ont également des assignations de réussite/échec, qui contribuent au taux de réussite du jeu de tests pour cette méthode de test.
Les labels ont un nom et une description. Une bonne description :
Est concis.
Contient les attributs que vous recherchez dans les réponses correspondantes.
Une stratégie pour les labels est d’en avoir deux : l’une est des réponses qui répondent correctement aux critères recherchés, et l’autre pour des réponses qui ne répondent pas. P. ex., un test personnalisé de conformité à la politique RH peut comporter Conforme et Non conforme comme étiquettes.
Lorsque vous ajoutez ou modifiez des méthodes de test, sélectionnez Personnalisé.
Entrez un nom pour ce test personnalisé.
Ajoutez des instructions d’évaluation.
Ajoutez au moins deux étiquettes. Chaque étiquette a un nom et une description.
Pour ajouter plus d’étiquettes, sélectionnez Ajouter une étiquette.
Les titres des étiquettes ne peuvent contenir que des lettres, des nombres, des espaces, des traits
-, des traits de soulignement_, des barres obliques/, des esperluettes&, des signes ++et des points..Définissez le résultat Réussi ou Échec pour chaque étiquette.
Cliquez sur OK.