BertTokenizer Classe

Definizione

Tokenizer per il modello Bert.

public sealed class BertTokenizer : Microsoft.ML.Tokenizers.WordPieceTokenizer
type BertTokenizer = class
    inherit WordPieceTokenizer
Public NotInheritable Class BertTokenizer
Inherits WordPieceTokenizer
Ereditarietà

Commenti

BertTokenizer è basato su WordPieceTokenizer e viene usato per tokenizzare il testo per i modelli Bert. L'implementazione di BertTokenizer si basa sull'implementazione originale di Bert nella libreria Hugging Face Transformers. https://huggingface.co/transformers/v3.0.2/model_doc/bert.html?highlight=berttokenizerfast#berttokenizer

Proprietà

Nome Descrizione
ApplyBasicTokenization

Ottiene un valore che indica se il tokenizer deve eseguire la tokenizzazione di base. Come il testo pulito, normalizzarlo, abbassarlo e così via.

ClassificationToken

Ottiene il token del classificatore utilizzato per eseguire la classificazione della sequenza (classificazione dell'intera sequenza invece della classificazione per token). È il primo token della sequenza quando viene compilato con token speciali.

ClassificationTokenId

Ottiene l'ID del token del classificatore

ContinuingSubwordPrefix

Ottiene il prefisso da utilizzare per le parole secondarie che non sono la prima parte di una parola.

(Ereditato da WordPieceTokenizer)
IndividuallyTokenizeCjk

Ottiene un valore che indica se il tokenizer deve suddividere i caratteri CJK in token.

LowerCaseBeforeTokenization

Ottiene un valore che indica se il tokenizer deve in minuscolo il testo di input.

MaskingToken

Ottiene il token mask utilizzato per mascherare i valori. Questo è il token usato per il training di questo modello con la modellazione del linguaggio mascherata. Si tratta del token che il modello tenterà di stimare.

MaskingTokenId

Ottiene l'ID del token mask

MaxInputCharsPerWord

Ottiene il numero massimo di caratteri da autorizzare in una singola parola.

(Ereditato da WordPieceTokenizer)
Normalizer

Ottiene il normalizer in uso dal tokenizer.

(Ereditato da WordPieceTokenizer)
PaddingToken

Ottiene il token utilizzato per la spaziatura interna, ad esempio durante l'invio in batch di sequenze di lunghezze diverse

PaddingTokenId

Ottiene l'ID del token di riempimento

PreTokenizer

Ottiene il preTokenizer utilizzato dal tokenizer.

(Ereditato da WordPieceTokenizer)
RemoveNonSpacingMarks

Ottiene un valore che indica se rimuovere segni di non spaziatura.

SeparatorToken

Ottiene il token separatore, che viene utilizzato durante la compilazione di una sequenza da più sequenze, ad esempio due sequenze per la classificazione delle sequenze o per un testo e una domanda per la risposta alle domande. Viene usato anche come ultimo token di una sequenza compilata con token speciali.

SeparatorTokenId

Ottiene l'ID del token separatore

SpecialTokens

Ottiene i token speciali e gli ID corrispondenti.

(Ereditato da WordPieceTokenizer)
SplitOnSpecialTokens

Ottiene un valore che indica se il tokenizer deve essere suddiviso nei token speciali o considerare i token speciali come testo normale.

UnknownToken

Ottiene il token sconosciuto. Un token non incluso nel vocabolario non può essere convertito in un ID ed è impostato come token.

(Ereditato da WordPieceTokenizer)
UnknownTokenId

Ottiene l'ID del token sconosciuto. Un token non incluso nel vocabolario non può essere convertito in un ID ed è impostato come token.

(Ereditato da WordPieceTokenizer)

Metodi

Nome Descrizione
BuildInputsWithSpecialTokens(IEnumerable<Int32>, IEnumerable<Int32>)

Creare input del modello da una sequenza o una coppia di sequenze per le attività di classificazione sequenza concatenando e aggiungendo token speciali. Una sequenza BERT ha il formato seguente: - sequenza singola: [CLS] tokenIds [SEP] - coppia di sequenze: [CLS] tokenIds [SEP] additionalTokenIds [SEP]

BuildInputsWithSpecialTokens(IEnumerable<Int32>, Span<Int32>, Int32, IEnumerable<Int32>)

Creare input del modello da una sequenza o una coppia di sequenze per le attività di classificazione sequenza concatenando e aggiungendo token speciali. Una sequenza BERT ha il formato seguente: - sequenza singola: [CLS] tokenIds [SEP] - coppia di sequenze: [CLS] tokenIds [SEP] additionalTokenIds [SEP]

CountTokens(ReadOnlySpan<Char>, Boolean, Boolean)

Ottenere il numero di token a cui verrà codificato il testo di input.

(Ereditato da Tokenizer)
CountTokens(String, Boolean, Boolean)

Ottenere il numero di token a cui verrà codificato il testo di input.

(Ereditato da Tokenizer)
CountTokens(String, ReadOnlySpan<Char>, EncodeSettings)

Ottenere il numero di token a cui verrà codificato il testo di input.

(Ereditato da WordPieceTokenizer)
Create(Stream, BertOptions)

Creare una nuova istanza della BertTokenizer classe .

Create(String, BertOptions)

Creare una nuova istanza della BertTokenizer classe .

CreateAsync(Stream, BertOptions, CancellationToken)

Creare una nuova istanza della BertTokenizer classe in modo asincrono.

CreateAsync(String, BertOptions, CancellationToken)

Creare una nuova istanza della BertTokenizer classe in modo asincrono.

CreateTokenTypeIdsFromSequences(IEnumerable<Int32>, IEnumerable<Int32>)

Creare una maschera dalle due sequenze passate da usare in un'attività di classificazione di coppie di sequenze. Una maschera di coppia di sequenze BERT ha il formato seguente: 0 0 0 0 0 0 0 0 0 0 1 1 1 1 1 1 1 1 1 1 1 | prima sequenza | seconda sequenza | Se additionalTokenIds è Null, questo metodo restituisce solo la prima parte degli ID di tipo (0s).

CreateTokenTypeIdsFromSequences(IEnumerable<Int32>, Span<Int32>, Int32, IEnumerable<Int32>)

Tokenizer per il modello Bert.

Decode(IEnumerable<Int32>, Boolean)

Decodificare gli ID specificati, tornare a un valore String.

(Ereditato da WordPieceTokenizer)
Decode(IEnumerable<Int32>, Span<Char>, Boolean, Int32, Int32)

Decodificare gli ID specificati nel testo e archiviare il risultato nell'intervallo destination .

(Ereditato da WordPieceTokenizer)
Decode(IEnumerable<Int32>, Span<Char>, Int32, Int32)

Decodificare gli ID specificati nel testo e archiviare il risultato nell'intervallo destination .

(Ereditato da WordPieceTokenizer)
Decode(IEnumerable<Int32>)

Decodificare gli ID specificati, tornare a un valore String.

(Ereditato da WordPieceTokenizer)
EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean, Boolean)

Codifica il testo di input in ID token.

EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean)

Codifica il testo di input in ID token.

EncodeToIds(ReadOnlySpan<Char>, Int32, Boolean, String, Int32, Boolean, Boolean)

Codifica il testo di input in ID token.

EncodeToIds(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

Codifica il testo di input in ID token.

EncodeToIds(String, Boolean, Boolean, Boolean)

Codifica il testo di input in ID token.

EncodeToIds(String, Boolean, Boolean)

Codifica il testo di input in ID token.

EncodeToIds(String, Int32, Boolean, String, Int32, Boolean, Boolean)

Codifica il testo di input in ID token.

EncodeToIds(String, Int32, String, Int32, Boolean, Boolean)

Codifica il testo di input in ID token.

EncodeToIds(String, ReadOnlySpan<Char>, EncodeSettings)

Codifica il testo di input in ID token.

(Ereditato da WordPieceTokenizer)
EncodeToTokens(ReadOnlySpan<Char>, String, Boolean, Boolean)

Codifica il testo di input in un elenco di EncodedToken.

(Ereditato da Tokenizer)
EncodeToTokens(String, ReadOnlySpan<Char>, EncodeSettings)

Codifica il testo di input in un elenco di EncodedToken.

(Ereditato da WordPieceTokenizer)
EncodeToTokens(String, String, Boolean, Boolean)

Codifica il testo di input in un elenco di EncodedToken.

(Ereditato da Tokenizer)
GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

Trovare l'indice della capacità di codifica massima senza superare il limite di token.

(Ereditato da Tokenizer)
GetIndexByTokenCount(String, Int32, String, Int32, Boolean, Boolean)

Trovare l'indice della capacità di codifica massima senza superare il limite di token.

(Ereditato da Tokenizer)
GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32)

Trovare l'indice della capacità di codifica massima senza superare il limite di token.

(Ereditato da WordPieceTokenizer)
GetIndexByTokenCountFromEnd(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

Trovare l'indice della capacità di codifica massima senza superare il limite di token.

(Ereditato da Tokenizer)
GetIndexByTokenCountFromEnd(String, Int32, String, Int32, Boolean, Boolean)

Trovare l'indice della capacità di codifica massima senza superare il limite di token.

(Ereditato da Tokenizer)
GetSpecialTokensMask(IEnumerable<Int32>, IEnumerable<Int32>, Boolean)

Recuperare la maschera token di sequenza da un elenco di ID.

GetSpecialTokensMask(IEnumerable<Int32>, Span<Int32>, Int32, IEnumerable<Int32>, Boolean)

Recuperare la maschera token di sequenza da un elenco di ID.

Si applica a