Microsoft.ML.Tokenizers Spazio dei nomi

Classi

Nome Descrizione
BertOptions

Opzioni per il tokenizer Bert.

BertTokenizer

Tokenizer per il modello Bert.

BitVector
Bpe

Rappresentare il modello di codifica della coppia di byte.

BpeDecoder

Consente di decodificare il BPE originale unendo tutti i token e quindi sostituendo il suffisso usato per identificare la fine delle parole da spazi vuoti

BpeTokenizer

Rappresentare il modello di codifica della coppia di byte.

BpeTrainer

Il trainer Bpe responsabile del training del modello Bpe.

CodeGenTokenizer

Rappresentare il modello di codifica della coppia di byte. Implementare il tokenizer CodeGen descritto in https://huggingface.co/docs/transformers/main/en/model_doc/codegen#overview

DawgBuilder
EnglishRoberta

Rappresentare il modello di codifica della coppia di byte.

EnglishRobertaTokenizer

Rappresentare il modello di codifica della coppia di byte.

LlamaTokenizer

LlamaTokenizer è SentencePieceTokenizer implementato in base a https://github.com/google/sentencepiece.

LowerCaseNormalizer

Normalizzare la stringa in formato minuscolo prima di elaborarla con il tokenizer.

Model

Rappresenta un modello usato durante la tokenizzazione, ad esempio BPE o Word Piece o Unigram.

Normalizer

Normalizzare la stringa prima di elaborarla con il tokenizer.

Phi2Tokenizer

Rappresentare il modello di codifica della coppia di byte. Implementare il tokenizer Phi2 descritto in https://huggingface.co/microsoft/phi-2

PreTokenizer

Classe di base per tutte le classi di pre-tokenizer. Il preTokenizer è responsabile dell'esecuzione del passaggio di pre-segmentazione.

RegexPreTokenizer

Pre-tokenizer per il tokenizer Tiktoken.

RobertaPreTokenizer

Tokenizer di pre-tokenizzatore per Roberta English tokenizer.

SentencePieceNormalizer

Normalizzare la stringa in base alla normalizzazione SentencePiece.

SentencePieceTokenizer

SentencePieceBpe è un tokenizer che suddivide l'input in token usando il modello SentencePiece Bpe.

Split

Questa divisione contiene il token di divisione sottostante e i relativi offset nella stringa originale. Questi offset si trovano nell'oggetto original referenziale. Contiene anche qualsiasi Token elemento associato alla divisione corrente.

TiktokenTokenizer

Rappresenta il tokenizer di codifica rapida della coppia di byte.

Token

Rappresenta il token generato dal processo di tokenizzazione contenente la sottostringa del token, l'ID associato alla sottostringa del token e il mapping dell'offset alla stringa originale.

Tokenizer

Fornisce un'astrazione per i tokenizer, abilitando la codifica del testo in token e la decodifica degli ID token nel testo.

TokenizerDecoder

Un decodificatore ha la responsabilità di unire l'elenco specificato di token in una stringa.

TokenizerResult

La codifica rappresenta l'output di un tokenizer.

Trainer

Un Trainer oggetto ha la responsabilità di eseguire il training di un modello. Lo si alimenta con righe/frasi e quindi può eseguire il training dell'oggetto specificato Model.

UpperCaseNormalizer

Normalizzare la stringa in formato maiuscolo prima di elaborarla con il tokenizer.

WhiteSpace

Pre-tokenizzatore che divide il testo in corrispondenza del limite della parola. La parola è un set di caratteri alfabetici, numerici e di sottolineatura.

WordPieceOptions

Opzioni per il tokenizer WordPiece.

WordPieceTokenizer

Rappresenta il tokenizer WordPiece.

Struct

Nome Descrizione
AddedToken

Rappresentare un token aggiunto dall'utente sopra il vocabolario del modello esistente. AddedToken può essere configurato per specificare il comportamento che deve avere in diverse situazioni, ad esempio:

  • Indica se devono corrispondere solo a singole parole
  • Indica se includere uno spazio vuoto a sinistra o a destra
EncodedToken

Rappresenta il token generato dal processo di tokenizzazione contenente la sottostringa del token, l'ID associato alla sottostringa del token e il mapping dell'offset alla stringa originale.

EncodeResults<T>

Risultato della codifica di un testo.

EncodeSettings

Impostazioni utilizzate per codificare un testo.

NormalizedString

Contiene la stringa normalizzata e il mapping alla stringa originale.

Progress

Enumerazioni

Nome Descrizione
ProgressState

Rappresenta lo stato dell'avanzamento segnalato.

Delegati

Nome Descrizione
ReportProgress