BertTokenizer Classe
Definizione
Importante
Alcune informazioni sono relative alla release non definitiva del prodotto, che potrebbe subire modifiche significative prima della release definitiva. Microsoft non riconosce alcuna garanzia, espressa o implicita, in merito alle informazioni qui fornite.
Tokenizer per il modello Bert.
public sealed class BertTokenizer : Microsoft.ML.Tokenizers.WordPieceTokenizer
type BertTokenizer = class
inherit WordPieceTokenizer
Public NotInheritable Class BertTokenizer
Inherits WordPieceTokenizer
- Ereditarietà
Commenti
BertTokenizer è basato su WordPieceTokenizer e viene usato per tokenizzare il testo per i modelli Bert. L'implementazione di BertTokenizer si basa sull'implementazione originale di Bert nella libreria Hugging Face Transformers. https://huggingface.co/transformers/v3.0.2/model_doc/bert.html?highlight=berttokenizerfast#berttokenizer
Proprietà
| Nome | Descrizione |
|---|---|
| ApplyBasicTokenization |
Ottiene un valore che indica se il tokenizer deve eseguire la tokenizzazione di base. Come il testo pulito, normalizzarlo, abbassarlo e così via. |
| ClassificationToken |
Ottiene il token del classificatore utilizzato per eseguire la classificazione della sequenza (classificazione dell'intera sequenza invece della classificazione per token). È il primo token della sequenza quando viene compilato con token speciali. |
| ClassificationTokenId |
Ottiene l'ID del token del classificatore |
| ContinuingSubwordPrefix |
Ottiene il prefisso da utilizzare per le parole secondarie che non sono la prima parte di una parola. (Ereditato da WordPieceTokenizer) |
| IndividuallyTokenizeCjk |
Ottiene un valore che indica se il tokenizer deve suddividere i caratteri CJK in token. |
| LowerCaseBeforeTokenization |
Ottiene un valore che indica se il tokenizer deve in minuscolo il testo di input. |
| MaskingToken |
Ottiene il token mask utilizzato per mascherare i valori. Questo è il token usato per il training di questo modello con la modellazione del linguaggio mascherata. Si tratta del token che il modello tenterà di stimare. |
| MaskingTokenId |
Ottiene l'ID del token mask |
| MaxInputCharsPerWord |
Ottiene il numero massimo di caratteri da autorizzare in una singola parola. (Ereditato da WordPieceTokenizer) |
| Normalizer |
Ottiene il normalizer in uso dal tokenizer. (Ereditato da WordPieceTokenizer) |
| PaddingToken |
Ottiene il token utilizzato per la spaziatura interna, ad esempio durante l'invio in batch di sequenze di lunghezze diverse |
| PaddingTokenId |
Ottiene l'ID del token di riempimento |
| PreTokenizer |
Ottiene il preTokenizer utilizzato dal tokenizer. (Ereditato da WordPieceTokenizer) |
| RemoveNonSpacingMarks |
Ottiene un valore che indica se rimuovere segni di non spaziatura. |
| SeparatorToken |
Ottiene il token separatore, che viene utilizzato durante la compilazione di una sequenza da più sequenze, ad esempio due sequenze per la classificazione delle sequenze o per un testo e una domanda per la risposta alle domande. Viene usato anche come ultimo token di una sequenza compilata con token speciali. |
| SeparatorTokenId |
Ottiene l'ID del token separatore |
| SpecialTokens |
Ottiene i token speciali e gli ID corrispondenti. (Ereditato da WordPieceTokenizer) |
| SplitOnSpecialTokens |
Ottiene un valore che indica se il tokenizer deve essere suddiviso nei token speciali o considerare i token speciali come testo normale. |
| UnknownToken |
Ottiene il token sconosciuto. Un token non incluso nel vocabolario non può essere convertito in un ID ed è impostato come token. (Ereditato da WordPieceTokenizer) |
| UnknownTokenId |
Ottiene l'ID del token sconosciuto. Un token non incluso nel vocabolario non può essere convertito in un ID ed è impostato come token. (Ereditato da WordPieceTokenizer) |
Metodi
| Nome | Descrizione |
|---|---|
| BuildInputsWithSpecialTokens(IEnumerable<Int32>, IEnumerable<Int32>) |
Creare input del modello da una sequenza o una coppia di sequenze per le attività di classificazione sequenza concatenando e aggiungendo token speciali. Una sequenza BERT ha il formato seguente: - sequenza singola: |
| BuildInputsWithSpecialTokens(IEnumerable<Int32>, Span<Int32>, Int32, IEnumerable<Int32>) |
Creare input del modello da una sequenza o una coppia di sequenze per le attività di classificazione sequenza concatenando e aggiungendo token speciali. Una sequenza BERT ha il formato seguente: - sequenza singola: |
| CountTokens(ReadOnlySpan<Char>, Boolean, Boolean) |
Ottenere il numero di token a cui verrà codificato il testo di input. (Ereditato da Tokenizer) |
| CountTokens(String, Boolean, Boolean) |
Ottenere il numero di token a cui verrà codificato il testo di input. (Ereditato da Tokenizer) |
| CountTokens(String, ReadOnlySpan<Char>, EncodeSettings) |
Ottenere il numero di token a cui verrà codificato il testo di input. (Ereditato da WordPieceTokenizer) |
| Create(Stream, BertOptions) |
Creare una nuova istanza della BertTokenizer classe . |
| Create(String, BertOptions) |
Creare una nuova istanza della BertTokenizer classe . |
| CreateAsync(Stream, BertOptions, CancellationToken) |
Creare una nuova istanza della BertTokenizer classe in modo asincrono. |
| CreateAsync(String, BertOptions, CancellationToken) |
Creare una nuova istanza della BertTokenizer classe in modo asincrono. |
| CreateTokenTypeIdsFromSequences(IEnumerable<Int32>, IEnumerable<Int32>) |
Creare una maschera dalle due sequenze passate da usare in un'attività di classificazione di coppie di sequenze. Una maschera di coppia di sequenze BERT ha il formato seguente: 0 0 0 0 0 0 0 0 0 0 1 1 1 1 1 1 1 1 1 1 1 | prima sequenza | seconda sequenza | Se |
| CreateTokenTypeIdsFromSequences(IEnumerable<Int32>, Span<Int32>, Int32, IEnumerable<Int32>) |
Tokenizer per il modello Bert. |
| Decode(IEnumerable<Int32>, Boolean) |
Decodificare gli ID specificati, tornare a un valore String. (Ereditato da WordPieceTokenizer) |
| Decode(IEnumerable<Int32>, Span<Char>, Boolean, Int32, Int32) |
Decodificare gli ID specificati nel testo e archiviare il risultato nell'intervallo |
| Decode(IEnumerable<Int32>, Span<Char>, Int32, Int32) |
Decodificare gli ID specificati nel testo e archiviare il risultato nell'intervallo |
| Decode(IEnumerable<Int32>) |
Decodificare gli ID specificati, tornare a un valore String. (Ereditato da WordPieceTokenizer) |
| EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean, Boolean) |
Codifica il testo di input in ID token. |
| EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean) |
Codifica il testo di input in ID token. |
| EncodeToIds(ReadOnlySpan<Char>, Int32, Boolean, String, Int32, Boolean, Boolean) |
Codifica il testo di input in ID token. |
| EncodeToIds(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Codifica il testo di input in ID token. |
| EncodeToIds(String, Boolean, Boolean, Boolean) |
Codifica il testo di input in ID token. |
| EncodeToIds(String, Boolean, Boolean) |
Codifica il testo di input in ID token. |
| EncodeToIds(String, Int32, Boolean, String, Int32, Boolean, Boolean) |
Codifica il testo di input in ID token. |
| EncodeToIds(String, Int32, String, Int32, Boolean, Boolean) |
Codifica il testo di input in ID token. |
| EncodeToIds(String, ReadOnlySpan<Char>, EncodeSettings) |
Codifica il testo di input in ID token. (Ereditato da WordPieceTokenizer) |
| EncodeToTokens(ReadOnlySpan<Char>, String, Boolean, Boolean) |
Codifica il testo di input in un elenco di EncodedToken. (Ereditato da Tokenizer) |
| EncodeToTokens(String, ReadOnlySpan<Char>, EncodeSettings) |
Codifica il testo di input in un elenco di EncodedToken. (Ereditato da WordPieceTokenizer) |
| EncodeToTokens(String, String, Boolean, Boolean) |
Codifica il testo di input in un elenco di EncodedToken. (Ereditato da Tokenizer) |
| GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Trovare l'indice della capacità di codifica massima senza superare il limite di token. (Ereditato da Tokenizer) |
| GetIndexByTokenCount(String, Int32, String, Int32, Boolean, Boolean) |
Trovare l'indice della capacità di codifica massima senza superare il limite di token. (Ereditato da Tokenizer) |
| GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32) |
Trovare l'indice della capacità di codifica massima senza superare il limite di token. (Ereditato da WordPieceTokenizer) |
| GetIndexByTokenCountFromEnd(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Trovare l'indice della capacità di codifica massima senza superare il limite di token. (Ereditato da Tokenizer) |
| GetIndexByTokenCountFromEnd(String, Int32, String, Int32, Boolean, Boolean) |
Trovare l'indice della capacità di codifica massima senza superare il limite di token. (Ereditato da Tokenizer) |
| GetSpecialTokensMask(IEnumerable<Int32>, IEnumerable<Int32>, Boolean) |
Recuperare la maschera token di sequenza da un elenco di ID. |
| GetSpecialTokensMask(IEnumerable<Int32>, Span<Int32>, Int32, IEnumerable<Int32>, Boolean) |
Recuperare la maschera token di sequenza da un elenco di ID. |