你当前正在访问 Microsoft Azure Global Edition 技术文档网站。 如果需要访问由世纪互联运营的 Microsoft Azure 中国技术文档网站,请访问 https://docs.azure.cn

microsoft-cognitiveservices-speech-sdk package

ActivityReceivedEventArgs

定义收到的消息/事件的内容。 活动已收到事件Args

AudioConfig

表示用于指定要使用的输入类型的音频输入配置(麦克风、文件、流)。 AudioConfig 更新于版本 1.11.0

AudioInputStream

表示用于自定义音频输入配置的音频输入流。 AudioInputStream

AudioOutputStream

表示用于自定义音频输出配置的音频输出流。 音频输出流

AudioStreamFormat

表示用于自定义音频输入配置的音频流格式。 音频流格式

AutoDetectSourceLanguageConfig

语言自动检测配置。 AutoDetectSourceLanguageConfig 在版本 1.13.0 中添加。

AutoDetectSourceLanguageResult

输出格式:AutoDetectSourceLanguageResult(自动检测源语言结果)

AvatarConfig

定义说话虚拟形象配置。 AvatarConfig 于版本 1.33.0 中添加

该功能仍处于实验阶段,可能会有所变化或支持有限。

AvatarEventArgs

定义用于聊天头像事件的内容。 AvatarEventArgs 于版本 1.33.0 中添加

该功能仍处于实验阶段,可能会有所变化或支持有限。

AvatarSceneConfig

定义了用于控制头像位置和方向的头像场景配置。 AvatarSceneConfig 于版本 1.44.0 中添加

该功能仍处于实验阶段,可能会有所变化或支持有限。

AvatarSynthesizer

定义头像合成器。 Avatar合成器 1.33.0版本新增

该功能仍处于实验阶段,可能会有所变化或支持有限。

AvatarVideoFormat

定义虚拟形象输出视频格式。 AvatarVideoFormat 于1.33.0版本中添加

此功能仍属实验性,未来可能会有所变化。

AvatarWebRTCConnectionResult

定义虚拟形象 WebRTC 连接结果。 AvatarWebRTCConnectionResult 于版本 1.33.0 中添加

此功能仍属实验性,未来可能会有所变化。

BaseAudioPlayer

基础音频播放器类 TODO:目前仅播放 PCM。

BotFrameworkConfig

定义用于使用 Bot Framework 后端的对话框服务连接器对象的配置的类。 BotFrameworkConfig

CancellationDetails

包含有关取消结果的原因的详细信息。 CancellationDetails

CancellationDetailsBase

包含有关取消结果的原因的详细信息。 取消详情基地

Connection

连接是一个代理类,用于管理与指定识别器语音服务的连接。 默认情况下,识别器会根据需要自主管理与服务的连接。 Connection 类为用户提供其他方法来显式打开或关闭连接并订阅连接状态更改。 使用连接是可选的,主要适用于需要根据连接状态微调应用程序行为的情况。 用户可以选择先调用 Open(),在开始识别与此连接关联的识别器上开始识别之前,提前手动设置连接。 如果识别器需要连接或断开连接到服务,它将独立设置或关闭连接。 在这种情况下,连接将通过连接/已断开连接事件更改连接状态来通知连接。 在版本 1.2.1 中添加。

ConnectionEventArgs

为连接/断开连接等连接事件定义有效负载。 在版本 1.2.0 中添加

ConnectionMessage

ConnectionMessage 表示从语音服务发送和接收的实现特定消息。 这些消息用于调试目的,不应用于 Azure 认知服务语音服务的生产用例。 发送到语音服务并从中接收的消息可能会更改,而不通知。 这包括消息内容、标头、有效负载、排序等。在版本 1.11.0 中添加。

ConnectionMessageEventArgs
ConversationTranscriber

通过说话人与麦克风、文件或其他音频输入流的分离执行语音识别,并因此获取转录的文本。 会话转录器

ConversationTranscriptionCanceledEventArgs

定义 RecognitionErrorEvent 的内容。 ConversationTranscriptionCanceledEventArgs

ConversationTranscriptionEventArgs

定义聊天转录/转录事件的内容。 ConversationTranscriptionEventArgs

ConversationTranscriptionResult

定义聊天听录的结果。 ConversationTranscriptionResult

Coordinate

在 2D 空间中定义坐标。 坐标 1.33.0版本新增

CustomCommandsConfig

定义用于使用 CustomCommands 后端的对话框服务连接器对象的配置的类。 CustomCommandsConfig

Diagnostics

定义用于管理在版本 1.21.0 中添加的控制台输出的诊断 API

DialogServiceConfig

定义对话服务连接器DialogServiceConfig基础配置的类

DialogServiceConnector

对话服务连接器 对话框服务连接器

KeywordRecognitionModel

表示当用户说关键字启动进一步语音识别时用于识别的关键字识别模型。 KeywordRecognitionModel

Meeting
MeetingTranscriber
MeetingTranscriptionCanceledEventArgs

定义 MeetingTranscriptionCanceledEvent 的内容。 MeetingTranscriptionCanceledEventArgs

MeetingTranscriptionEventArgs

定义会议转录/转录事件的内容。 MeetingTranscriptionEventArgs

NoMatchDetails

包含 NoMatch 识别结果的详细信息。 无匹配详情

Participant

代表会议参与者。 在版本 1.4.0 中添加

PhraseListGrammar

允许添加新短语以提高语音识别。

添加到识别器中的短语在下一次识别开始时有效,或者下次 SpeechSDK 必须重新连接到语音服务时有效。

PronunciationAssessmentConfig

发音评估配置。 PronunciationAssessmentConfig 于 1.15.0 版本中添加。

PronunciationAssessmentResult

发音评估结果。 PronunciationAssessmentResult于1.15.0版本中添加。

PropertyCollection

表示属性及其值的集合。 PropertyCollection

PullAudioInputStream

表示用于自定义音频输入配置的音频输入流。 AudioInputStream

PullAudioInputStreamCallback

定义自定义音频输入流的回调方法(read()和 close()的抽象基类。 拉音频输入流回调

PullAudioOutputStream

表示用于自定义音频输出配置的内存支持的推送音频输出流。 拉音频输出流

PushAudioInputStream

表示用于自定义音频输入配置的内存支持的推送音频输入流。 PushAudioInputStream

PushAudioOutputStream

表示用于自定义音频输出配置的音频输出流。 音频输出流

PushAudioOutputStreamCallback

定义自定义音频输出流的回调方法(write()和 close()的抽象基类。 PushAudioOutputStream回调

RecognitionEventArgs

定义会话事件的有效负载,例如语音启动/检测到的结束

RecognitionResult

定义语音识别的结果。 RecognitionResult

Recognizer

定义主要包含常见事件处理程序的基类识别器。 识别器

ServiceEventArgs

为版本 1.9.0 中添加的任何服务消息事件定义有效负载

SessionEventArgs

定义会话事件的内容,如 SessionStarted/Stopped、SoundStarted/Stopped。 SessionEventArgs

SourceLanguageConfig

源语言配置。 SourceLanguageConfig

SpeakerAudioDestination

表示仅在浏览器中工作的扬声器播放音频目标。 注意:SDK 将尝试使用 媒体源扩展 播放音频。 Mp3 格式在 Microsoft Edge、Chrome 和 Safari(桌面)上具有更好的支持,因此最好指定 mp3 格式进行播放。 SpeakerAudioDestination 更新于1.17.0版本

SpeechConfig

语音配置。 SpeechConfig

SpeechConfigImpl

SpeechConfigImpl(语音配置控制)

SpeechRecognitionCanceledEventArgs
SpeechRecognitionEventArgs

定义语音识别/识别事件的内容。 SpeechRecognitionEventArgs

SpeechRecognitionResult

定义语音识别的结果。 SpeechRecognitionResult

SpeechRecognizer

从麦克风、文件或其他音频输入流执行语音识别,并因此获取转录的文本。 语音识别器

SpeechSynthesisBookmarkEventArgs

定义语音合成书签事件的内容。 SpeechSynthesisBookmarkEventArgs 于1.16.0版本中添加

SpeechSynthesisEventArgs

定义语音合成事件的内容。 SpeechSynthesisEventArgs 于版本 1.11.0 中添加

SpeechSynthesisRequest

表示支持文本流的语音合成请求。 注意:此类以预览版提供,将来的版本可能会更改。 语音合成请求

SpeechSynthesisRequestInputStream

表示语音合成请求文本流的输入流。 注意:此类以预览版提供,将来的版本可能会更改。 语音合成请求输入流

SpeechSynthesisResult

定义语音合成的结果。 语音合成结果 1.11.0 版本中添加

SpeechSynthesisVisemeEventArgs

定义语音合成视体事件的内容。 SpeechSynthesisVisemeEventArgs 于1.16.0版本中添加

SpeechSynthesisWordBoundaryEventArgs

定义语音合成单词边界事件的内容。 SpeechSynthesisWordBoundaryEventArgs 于1.11.0版本中添加

SpeechSynthesizer

定义用于文本转语音的 SpeechSynthesizer 类。 更新于1.16.0版本 语音合成器

SpeechTranslationConfig

语音翻译配置。 语音翻译配置

SynthesisResult

合成结果的基类 SynthesisResult 于版本 1.20.0 添加

SynthesisVoicesResult

定义语音合成的结果。 SynthesisVoicesResult 于版本 1.20.0 中添加

Synthesizer
TranslationRecognitionCanceledEventArgs

定义语音识别取消的结果事件的有效负载。 TranslationRecognitionCanceledEventArgs

TranslationRecognitionEventArgs

翻译文本结果事件参数。 TranslationRecognitionEventArgs

TranslationRecognitionResult

翻译文本结果。 TranslationRecognitionResult

TranslationRecognizer

翻译识别器 TranslationRecognitionr

TranslationSynthesisEventArgs

翻译综合事件参数 TranslationSynthesisEventArgs

TranslationSynthesisResult

定义翻译合成结果,即目标语言中翻译文本的语音输出。 TranslationSynthesisResult

Translations

表示参数及其值的集合。 翻译

TurnStatusReceivedEventArgs

定义收到的消息/事件的内容。 TurnStatusReceivedEventArgs

User
VoiceInfo

有关在版本 1.20.0 中添加的语音合成语音的信息。 VoiceInfo

接口

CancellationEventArgs
IParticipant

代表会议参与者。 在版本 1.4.0 中添加

IPlayer

表示音频播放器接口,用于控制音频播放,如暂停、恢复等。IPlayer 于1.12.0版本中添加

IVoiceJson
MeetingInfo
VoiceSignature

枚举

AudioFormatTag
CancellationErrorCode

定义 CancellationReason 为 Error 的错误代码。 已在版本 1.1.0 中添加。

CancellationReason

定义可能取消识别结果的原因。 CancellationReason

LanguageIdMode

语言识别模式 LanguageIdMode

LogLevel
NoMatchReason

定义无法识别识别结果的可能原因。 无匹配理由

OutputFormat

定义语音识别器输出格式。 OutputFormat

ProfanityOption

不雅内容选项。 在版本 1.7.0 中添加。

PronunciationAssessmentGradingSystem

定义发音分数校准的点系统;默认值为 FivePoint。 1.15.0版本新增 PronunciationAssessmentGradingSystem(发音评估评分系统)

PronunciationAssessmentGranularity

定义发音评估粒度;默认值为 Phoneme。 在1.15.0版本中添加 PronunciationAssessmentGranularity

PropertyId

定义语音属性 ID。 PropertyID

ResultReason

定义可能生成识别结果的可能原因。 ResultReason

ServicePropertyChannel

定义用于将属性设置传递给服务的通道。 在版本 1.7.0 中添加。

SpeechSynthesisBoundaryType

定义语音合成边界事件的边界类型。 SpeechSynthesisBoundaryType 于版本 1.21.0 中添加

SpeechSynthesisOutputFormat

定义语音合成音频输出格式。 SpeechSynthesisOutputFormat 已在版本 1.17.0 中更新

SpeechSynthesisRequestInputType

定义语音合成请求的输入类型。 语音合成请求输入类型

SynthesisVoiceGender

定义合成语音的性别。 在版本 1.20.0 中添加。

SynthesisVoiceType