Remarque
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de vous connecter ou de modifier des répertoires.
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de modifier des répertoires.
Cet article documente les opérations d’API REST d’inférence du plan de données (speech) de génération d’images et d’audio (reconnaissance vocale) pour Azure OpenAI dans la 2024-10-21 version en disponibilité générale. Pour connaître les achèvements de conversation, les incorporations, les achèvements et toutes les autres opérations, consultez la référence officielle de l’API REST OpenAI Azure.
Spécifications de l’API
La gestion et l’interaction avec les modèles et ressources OpenAI Azure sont réparties sur trois surfaces principales d’API :
- Plan de contrôle
- Plan de données - création
- Plan de données - inférence
Chaque surface/spécification API englobe un ensemble différent de capacités Azure OpenAI. Chaque API possède son propre ensemble unique de versions d’aperçu et d’API stable/généralement disponibles (GA). Les sorties de prévisualisation suivent actuellement un rythme mensuel.
Important
Il existe désormais une nouvelle API d’inférence d’aperçu. Découvrez-en plus dans notre guide du cycle de vie de l’API.
| API | Dernière version d’aperçu | Dernière sortie de GA | Spécifications | Description |
|---|---|---|---|---|
| Plan de contrôle | 2025-07-01-preview |
2025-06-01 |
Fichiers de spécifications | L’API du plan de contrôle est utilisée pour des opérations telles que la création de ressources, le déploiement de modèles et d’autres tâches de gestion des ressources de haut niveau. Le plan de contrôle régit également ce qui est possible à faire avec des fonctionnalités telles que Azure Resource Manager, Bicep, Terraform et Azure CLI. |
| Plan de données | v1 preview |
v1 |
Fichiers de spécifications | L’API du plan de données contrôle les opérations d’inférence et d’authoring. |
Authentication
Azure OpenAI propose deux méthodes d’authentification. Vous pouvez utiliser soit API Keys, soit Microsoft Entra ID.
Authentification par clé API : Pour ce type d’authentification, toutes les requêtes API doivent inclure la clé API dans l’en-tête
api-keyHTTP. Le Quickstart fournit des conseils pour passer des appels avec ce type d’authentification.Microsoft Entra ID : Vous pouvez authentifier un appel API à l’aide d’un jeton Microsoft Entra. Les jetons d’authentification sont inclus dans une requête en tant qu’en-tête Authorization. Le jeton fourni doit être précédé deBearer, par exempleBearer YOUR_AUTH_TOKEN. Vous pouvez lire notre guide pratique sur authentifier avec Microsoft Entra ID.
Versionnement de l’API REST
Les API de service sont versionnées à l’aide du api-version paramètre de requête. Toutes les versions suivent la structure de dates YYYY-MM-DD. Par exemple:
POST https://YOUR_RESOURCE_NAME.openai.azure.com/openai/deployments/YOUR_DEPLOYMENT_NAME/chat/completions?api-version=2024-06-01
Inférence dans les plans de données
Le reste de cet article traite des opérations d’image et audio dans la version en disponibilité générale de la spécification d’inférence du plan de données OpenAI Azure. 2024-10-21
Pour obtenir l’aperçu de l’image et des opérations audio, consultez les informations de référence sur l’image d’aperçu et l’API REST audio.
Transcriptions - Créer
POST https://{endpoint}/openai/deployments/{deployment-id}/audio/transcriptions?api-version=2024-10-21
Transcrit l’audio dans la langue d’entrée.
Paramètres d’URI
| Nom | Dans | Obligatoire | Catégorie | Description |
|---|---|---|---|---|
| endpoint | path | Oui | string url |
Pris en charge Azure terminaux OpenAI (protocole et nom d’hôte, par exemple : https://aoairesource.openai.azure.com. Remplacez « aoairesource » par le nom de votre ressource Azure OpenAI). https://{your-resource-name}.openai.azure.com |
| id-de-déploiement | path | Oui | string | ID de déploiement du modèle de reconnaissance vocale. Pour des informations sur les modèles pris en charge, voir [/azure/ai-foundry/openai/concepts/models#audio-models]. |
| version de l'API | Requête | Oui | string | Version de l’API |
En-tête de requête
| Nom | Obligatoire | Catégorie | Description |
|---|---|---|---|
| clé API | True | string | Fournissez ici la clé API Azure OpenAI |
Corps de la requête
Content-Type : multipart/form-data
| Nom | Catégorie | Description | Obligatoire | Par défaut |
|---|---|---|---|---|
| fichier | string | L’objet du fichier audio à transcrire. | Oui | |
| prompt | string | Un texte optionnel pour guider le style du modèle ou poursuivre un segment audio précédent. La consigne doit correspondre au langage audio. | Non | |
| format_de_réponse | audioResponseFormat | Définit le format de la sortie. | Non | |
| Température | number | La température d’échantillonnage, comprise entre 0 et 1. Des valeurs plus élevées comme 0,8 rendent la sortie plus aléatoire, tandis que des valeurs plus basses comme 0,2 la rendent plus ciblée et déterministe. Si elle est réglée à 0, le modèle utilisera la probabilité logarithmique pour augmenter automatiquement la température jusqu’à atteindre certains seuils. | Non | 0 |
| language | string | La langue de l’audio d’entrée. Fournir le langage d’entrée au format ISO-639-1 améliorera la précision et la latence. | Non |
Responses
Code de statut : 200
Description : OK
| Type de contenu | Type | Description |
|---|---|---|
| application/json | audioRéponse ou audioVerboseResponse | |
| texte brut | string | Texte transcrit au format de sortie (quand response_format était un texte de texte, vtt ou srt). |
Exemples
Example
Obtient le texte transcrit et les métadonnées associées à partir des données audio parlées fournies.
POST https://{endpoint}/openai/deployments/{deployment-id}/audio/transcriptions?api-version=2024-10-21
Réponses : Code de statut : 200
{
"body": {
"text": "A structured object when requesting json or verbose_json"
}
}
Example
Obtient le texte transcrit et les métadonnées associées à partir des données audio parlées fournies.
POST https://{endpoint}/openai/deployments/{deployment-id}/audio/transcriptions?api-version=2024-10-21
"---multipart-boundary\nContent-Disposition: form-data; name=\"file\"; filename=\"file.wav\"\nContent-Type: application/octet-stream\n\nRIFF..audio.data.omitted\n---multipart-boundary--"
Réponses : Code de statut : 200
{
"type": "string",
"example": "plain text when requesting text, srt, or vtt"
}
Traductions - Create
POST https://{endpoint}/openai/deployments/{deployment-id}/audio/translations?api-version=2024-10-21
Transcrit et traduit l’audio d’entrée en texte anglais.
Paramètres d’URI
| Nom | Dans | Obligatoire | Catégorie | Description |
|---|---|---|---|---|
| endpoint | path | Oui | string url |
Pris en charge Azure terminaux OpenAI (protocole et nom d’hôte, par exemple : https://aoairesource.openai.azure.com. Remplacez « aoairesource » par le nom de votre ressource Azure OpenAI). https://{your-resource-name}.openai.azure.com |
| id-de-déploiement | path | Oui | string | ID de déploiement du modèle de transcription qui a été déployé. Pour des informations sur les modèles pris en charge, voir [/azure/ai-foundry/openai/concepts/models#audio-models]. |
| version de l'API | Requête | Oui | string | Version de l’API |
En-tête de requête
| Nom | Obligatoire | Catégorie | Description |
|---|---|---|---|
| clé API | True | string | Fournissez ici la clé API Azure OpenAI |
Corps de la requête
Content-Type : multipart/form-data
| Nom | Catégorie | Description | Obligatoire | Par défaut |
|---|---|---|---|---|
| fichier | string | Le fichier audio à traduire. | Oui | |
| prompt | string | Un texte optionnel pour guider le style du modèle ou poursuivre un segment audio précédent. Le prompt doit être en anglais. | Non | |
| format_de_réponse | audioResponseFormat | Définit le format de la sortie. | Non | |
| Température | number | La température d’échantillonnage, comprise entre 0 et 1. Des valeurs plus élevées comme 0,8 rendent la sortie plus aléatoire, tandis que des valeurs plus basses comme 0,2 la rendent plus ciblée et déterministe. Si elle est réglée à 0, le modèle utilisera la probabilité logarithmique pour augmenter automatiquement la température jusqu’à atteindre certains seuils. | Non | 0 |
Responses
Code de statut : 200
Description : OK
| Type de contenu | Type | Description |
|---|---|---|
| application/json | audioRéponse ou audioVerboseResponse | |
| texte brut | string | Texte transcrit au format de sortie (quand response_format était un texte de texte, vtt ou srt). |
Exemples
Example
Obtient le texte transcrit en anglais et les métadonnées associées à partir des données audio parlées fournies.
POST https://{endpoint}/openai/deployments/{deployment-id}/audio/translations?api-version=2024-10-21
"---multipart-boundary\nContent-Disposition: form-data; name=\"file\"; filename=\"file.wav\"\nContent-Type: application/octet-stream\n\nRIFF..audio.data.omitted\n---multipart-boundary--"
Réponses : Code de statut : 200
{
"body": {
"text": "A structured object when requesting json or verbose_json"
}
}
Example
Obtient le texte transcrit en anglais et les métadonnées associées à partir des données audio parlées fournies.
POST https://{endpoint}/openai/deployments/{deployment-id}/audio/translations?api-version=2024-10-21
"---multipart-boundary\nContent-Disposition: form-data; name=\"file\"; filename=\"file.wav\"\nContent-Type: application/octet-stream\n\nRIFF..audio.data.omitted\n---multipart-boundary--"
Réponses : Code de statut : 200
{
"type": "string",
"example": "plain text when requesting text, srt, or vtt"
}
Génération d'image
POST https://{endpoint}/openai/deployments/{deployment-id}/images/generations?api-version=2024-10-21
Génère un lot d’images à partir d’une légende texte sur un déploiement donné du modèle dall-e
Paramètres d’URI
| Nom | Dans | Obligatoire | Catégorie | Description |
|---|---|---|---|---|
| endpoint | path | Oui | string url |
Pris en charge Azure terminaux OpenAI (protocole et nom d’hôte, par exemple : https://aoairesource.openai.azure.com. Remplacez « aoairesource » par le nom de votre ressource Azure OpenAI). https://{your-resource-name}.openai.azure.com |
| id-de-déploiement | path | Oui | string | ID de déploiement du modèle dall-e qui a été déployé. |
| version de l'API | Requête | Oui | string | Version de l’API |
En-tête de requête
| Nom | Obligatoire | Catégorie | Description |
|---|---|---|---|
| clé API | True | string | Fournissez ici la clé API Azure OpenAI |
Corps de la requête
Content-Type : application/json
| Nom | Catégorie | Description | Obligatoire | Par défaut |
|---|---|---|---|---|
| prompt | string | Une description textuelle de l’image ou des images souhaitées. La longueur maximale est de 4 000 caractères. | Oui | |
| n | entier | Le nombre d’images à générer. | Non | 1 |
| size | imageSize | La taille des images générées. | Non | 1024x1024 |
| format_de_réponse | imagesResponseFormat | Le format dans lequel les images générées sont renvoyées. | Non | url |
| utilisateur | string | Un identifiant unique représentant votre utilisateur final, qui peut aider à surveiller et détecter les abus. | Non | |
| Qualité | imageQuality | La qualité de l’image qui sera générée. | Non | Norme |
| style | imageStyle | Le style des images générées. | Non | vivid |
Responses
Code de statut : 200
Description : Ok
| Type de contenu | Type | Description |
|---|---|---|
| application/json | generateImagesResponse |
Code de statut : par défaut
Description : Une erreur s’est produite.
| Type de contenu | Type | Description |
|---|---|---|
| application/json | dalleErrorResponse |
Exemples
Example
Crée des images à partir d’une invitation.
POST https://{endpoint}/openai/deployments/{deployment-id}/images/generations?api-version=2024-10-21
{
"prompt": "In the style of WordArt, Microsoft Clippy wearing a cowboy hat.",
"n": 1,
"style": "natural",
"quality": "standard"
}
Réponses : Code de statut : 200
{
"body": {
"created": 1698342300,
"data": [
{
"revised_prompt": "A vivid, natural representation of Microsoft Clippy wearing a cowboy hat.",
"prompt_filter_results": {
"sexual": {
"severity": "safe",
"filtered": false
},
"violence": {
"severity": "safe",
"filtered": false
},
"hate": {
"severity": "safe",
"filtered": false
},
"self_harm": {
"severity": "safe",
"filtered": false
},
"profanity": {
"detected": false,
"filtered": false
}
},
"url": "https://dalletipusw2.blob.core.windows.net/private/images/e5451cc6-b1ad-4747-bd46-b89a3a3b8bc3/generated_00.png?se=2023-10-27T17%3A45%3A09Z&...",
"content_filter_results": {
"sexual": {
"severity": "safe",
"filtered": false
},
"violence": {
"severity": "safe",
"filtered": false
},
"hate": {
"severity": "safe",
"filtered": false
},
"self_harm": {
"severity": "safe",
"filtered": false
}
}
}
]
}
}
Composants
Pour connaître les définitions de schéma utilisées par la conversation, les saisies semi-automatiques, les incorporations et d’autres opérations de texte, consultez la référence de l’API REST OpenAI Azure. Les schémas suivants prennent en charge les opérations d’image et audio sur cette page.
innerErrorCode
Codes d’erreur pour l’objet d’erreur interne.
Description : Codes d’erreur pour l’objet d’erreur interne.
Type : chaîne
Valeur par défaut :
Nom d’enum : InnerErrorCode
Valeurs d’énumération :
| Valeur | Description |
|---|---|
| ResponsibleAIPolicyViolation | La consigne a enfreint l’une des autres règles de filtrage de contenu. |
dalleErrorResponse
| Nom | Catégorie | Description | Obligatoire | Par défaut |
|---|---|---|---|---|
| erreur | dalleError | Non |
dalleError
| Nom | Catégorie | Description | Obligatoire | Par défaut |
|---|---|---|---|---|
| param | string | Non | ||
| type | string | Non | ||
| inner_error | dalleInnerError | Erreur intérieure avec des détails supplémentaires. | Non |
dalleInnerError
Erreur intérieure avec des détails supplémentaires.
| Nom | Catégorie | Description | Obligatoire | Par défaut |
|---|---|---|---|---|
| code | innerErrorCode | Codes d’erreur pour l’objet d’erreur interne. | Non | |
| content_filter_results | dalleFilterResults | Informations sur la catégorie de filtrage de contenu (haine, sexuel, violence, self_harm), si elle a été détectée, ainsi que sur le niveau de gravité (very_low, faible, moyen, élevé qui détermine l’intensité et le niveau de risque du contenu nuisible) et si elle a été filtrée ou non. Informations sur le contenu jailbreak et les jurons, s’ils ont été détectés, et si ils ont été filtrés ou non. Et des informations sur la liste de blocage des clients, si elle a été filtrée et son identifiant. | Non | |
| revised_prompt | string | La demande utilisée pour générer l’image, s’il y avait une révision de la requête. | Non |
Résultat de la sévérité du filtre de contenu
| Nom | Catégorie | Description | Obligatoire | Par défaut |
|---|---|---|---|---|
| filtered | booléen | Oui | ||
| severity | string | Non |
contentFilterDetectedResult
| Nom | Catégorie | Description | Obligatoire | Par défaut |
|---|---|---|---|---|
| filtered | booléen | Oui | ||
| détecté | booléen | Non |
dalleFilterResults
Informations sur la catégorie de filtrage de contenu (haine, sexuel, violence, self_harm), si elle a été détectée, ainsi que sur le niveau de gravité (very_low, faible, moyen, élevé qui détermine l’intensité et le niveau de risque du contenu nuisible) et si elle a été filtrée ou non. Informations sur le contenu jailbreak et les jurons, s’ils ont été détectés, et si ils ont été filtrés ou non. Et des informations sur la liste de blocage des clients, si elle a été filtrée et son identifiant.
| Nom | Catégorie | Description | Obligatoire | Par défaut |
|---|---|---|---|---|
| Sexuelle | résultatDeSévéritéDuFiltreDeContenu | Non | ||
| violence | résultatDeSévéritéDuFiltreDeContenu | Non | ||
| Déteste | résultatDeSévéritéDuFiltreDeContenu | Non | ||
| self_harm | résultatDeSévéritéDuFiltreDeContenu | Non | ||
| Blasphème | RésultatDeFiltreDeContenuDétecté | Non | ||
| jailbreak | RésultatDeFiltreDeContenuDétecté | Non |
réponse audio
Réponse à la traduction ou à la transcription lorsque response_format était json
| Nom | Catégorie | Description | Obligatoire | Par défaut |
|---|---|---|---|---|
| texte | string | Texte traduit ou transcrit. | Oui |
audioVerboseResponse
Réponse à la traduction ou à la transcription lorsque response_format était verbose_json
| Nom | Catégorie | Description | Obligatoire | Par défaut |
|---|---|---|---|---|
| texte | string | Texte traduit ou transcrit. | Oui | |
| tâche | string | Type de tâche audio. | Non | |
| language | string | Language. | Non | |
| durée | number | Durée. | Non | |
| segments | tableau | Non |
audioResponseFormat
Définit le format de la sortie.
Description : Définit le format de la sortie.
Type : chaîne
Valeur par défaut :
Valeurs d’énumération :
- Json
- texte
- SRT
- verbose_json
- vtt
imageQuality
La qualité de l’image qui sera générée.
Description : La qualité de l’image qui sera générée.
Type : chaîne
Valeur par défaut : standard
Nom Enum : Qualité
Valeurs d’énumération :
| Valeur | Description |
|---|---|
| Norme | La qualité standard crée des images avec une qualité standard. |
| hd | La qualité HD crée des images avec des détails plus fins et une plus grande cohérence à travers l’image. |
imagesResponseFormat
Le format dans lequel les images générées sont renvoyées.
Description : Le format dans lequel les images générées sont renvoyées.
Type : chaîne
Valeur par défaut : URL
Nom d’enum : ImagesResponseFormat
Valeurs d’énumération :
| Valeur | Description |
|---|---|
| url | L’URL qui permet un accès temporaire au téléchargement des images générées. |
| b64_json | Les images générées sont retournées sous forme de chaînes encodées en base64. |
taille de l’image
La taille des images générées.
Description : La taille des images générées.
Type : chaîne
Valeur par défaut : 1024x1024
Nom Enum : Taille
Valeurs d’énumération :
| Valeur | Description |
|---|---|
| 1792x1024 | La taille souhaitée de l’image générée est de 1792x1024 pixels. |
| 1024x1792 | La taille souhaitée de l’image générée est de 1024x1792 pixels. |
| 1024x1024 | La taille souhaitée de l’image générée est de 1024x1024 pixels. |
imageStyle
Le style des images générées.
Description : Le style des images générées.
Type : chaîne
Valeur par défaut : vif
Nom Enum : Style
Valeurs d’énumération :
| Valeur | Description |
|---|---|
| vivid | Vivid crée des images hyperréalistes et dramatiques. |
| Naturel | Le naturel crée des images plus naturales et moins hyperréalistes. |
generateImagesResponse
| Nom | Catégorie | Description | Obligatoire | Par défaut |
|---|---|---|---|---|
| créé | entier | L’horodatage Unix lors de la création de l’opération. | Oui | |
| Données | tableau | Les données de résultat de l’opération, si elles ont réussi | Oui |
Étapes suivantes
Découvrez les modèles et le réglage précis avec l’API REST. En savoir plus sur les modèles sous-jacents qui alimentent Azure OpenAI.