CodeGenTokenizer Klasse
Definition
Wichtig
Einige Informationen beziehen sich auf Vorabversionen, die vor dem Release ggf. grundlegend überarbeitet werden. Microsoft übernimmt hinsichtlich der hier bereitgestellten Informationen keine Gewährleistungen, seien sie ausdrücklich oder konkludent.
Represent the Byte Pair Encoding model. Implementieren des codeGen-Tokenizers, der in https://huggingface.co/docs/transformers/main/en/model_doc/codegen#overview
public class CodeGenTokenizer : Microsoft.ML.Tokenizers.Tokenizer
type CodeGenTokenizer = class
inherit Tokenizer
Public Class CodeGenTokenizer
Inherits Tokenizer
- Vererbung
- Abgeleitet
Eigenschaften
| Name | Beschreibung |
|---|---|
| AddBeginningOfSentence |
Ruft das Flag ab, das angibt, ob der Anfang des Satztokens in die Codierung eingeschlossen werden soll. |
| AddEndOfSentence |
Ruft das Flag ab, das angibt, ob das Ende des Satztokens in die Codierung eingeschlossen werden soll. |
| AddPrefixSpace |
Ruft das Flag ab, das angibt, ob vor dem Codieren des Texts ein führendes Leerzeichen eingeschlossen werden soll. |
| BeginningOfSentenceId |
Ruft das Ende des Satztokens-ID ab. |
| BeginningOfSentenceToken |
Ruft den Anfang des Satztokens ab. |
| EndOfSentenceId |
Ruft das Ende des Satztokens-ID ab. |
| EndOfSentenceToken |
Ruft das Ende des Satztokens ab. |
| Normalizer |
Ruft den vom Tokenizer verwendeten Normalizer ab. |
| PreTokenizer |
Ruft das vom Tokenizer verwendete PreTokenizer ab. |
| SpecialTokens |
Ruft die hinzugefügten Token ab. |
| UnknownToken |
Das unbekannte Token. |
| UnknownTokenId |
Ruft die unbekannte Token-ID ab. |
| Vocabulary |
Ruft die Wörterbuchzuordnungstoken zu IDs ab. |
Methoden
| Name | Beschreibung |
|---|---|
| CountTokens(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, Boolean, Boolean) |
Rufen Sie die Anzahl der Token ab, für die der Eingabetext codiert wird. |
| CountTokens(ReadOnlySpan<Char>, Boolean, Boolean) |
Rufen Sie die Anzahl der Token ab, für die der Eingabetext codiert wird. (Geerbt von Tokenizer) |
| CountTokens(String, Boolean, Boolean, Boolean, Boolean, Boolean) |
Rufen Sie die Anzahl der Token ab, für die der Eingabetext codiert wird. |
| CountTokens(String, Boolean, Boolean) |
Rufen Sie die Anzahl der Token ab, für die der Eingabetext codiert wird. (Geerbt von Tokenizer) |
| CountTokens(String, ReadOnlySpan<Char>, EncodeSettings) |
Rufen Sie die Anzahl der Token ab, für die der Eingabetext codiert wird. |
| Create(Stream, Stream, Boolean, Boolean, Boolean) |
Erstellen Sie einen CodeGen-Tokenizer aus dem angegebenen Aufruf und führt Datenströme zusammen. |
| Decode(IEnumerable<Int32>, Boolean, Boolean) |
Decodieren Sie die angegebenen IDs zurück zu einer Zeichenfolge. |
| Decode(IEnumerable<Int32>, Span<Char>, Boolean, Boolean, Int32, Int32) |
Decodieren Sie die angegebenen IDs wieder in Text, und speichern Sie das Ergebnis in der |
| Decode(IEnumerable<Int32>, Span<Char>, Int32, Int32) |
Decodieren Sie die angegebenen IDs wieder in Text, und speichern Sie das Ergebnis in der |
| Decode(IEnumerable<Int32>) |
Decodieren Sie die angegebenen IDs zurück zu einer Zeichenfolge. |
| EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, Boolean, Boolean) |
Codiert Eingabetext in Token-IDs. |
| EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean) |
Codiert Eingabetext in Token-IDs. (Geerbt von Tokenizer) |
| EncodeToIds(ReadOnlySpan<Char>, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean) |
Codiert Eingabetext in Token-IDs bis zur maximalen Anzahl von Token. |
| EncodeToIds(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Codiert Eingabetext in Token-IDs bis zur maximalen Anzahl von Token. (Geerbt von Tokenizer) |
| EncodeToIds(String, Boolean, Boolean, Boolean, Boolean, Boolean) |
Codiert Eingabetext in Token-IDs. |
| EncodeToIds(String, Boolean, Boolean) |
Codiert Eingabetext in Token-IDs. (Geerbt von Tokenizer) |
| EncodeToIds(String, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean) |
Codiert Eingabetext in Token-IDs bis zur maximalen Anzahl von Token. |
| EncodeToIds(String, Int32, String, Int32, Boolean, Boolean) |
Codiert Eingabetext in Token-IDs bis zur maximalen Anzahl von Token. <param name="text">Der zu codierenden Text.</param> (Geerbt von Tokenizer) |
| EncodeToIds(String, ReadOnlySpan<Char>, EncodeSettings) |
Codiert Eingabetext in Token-IDs. |
| EncodeToTokens(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, String, Boolean, Boolean) |
Codiert Eingabetext für Objekt mit der Tokenliste, Token-IDs, Token-Offsetzuordnung. |
| EncodeToTokens(ReadOnlySpan<Char>, String, Boolean, Boolean) |
Codiert Eingabetext in eine Liste von EncodedTokens. (Geerbt von Tokenizer) |
| EncodeToTokens(String, Boolean, Boolean, Boolean, String, Boolean, Boolean) |
Codiert Eingabetext für Objekt mit der Tokenliste, Token-IDs, Token-Offsetzuordnung. |
| EncodeToTokens(String, ReadOnlySpan<Char>, EncodeSettings) |
Codiert Eingabetext in eine Liste von EncodedTokens. |
| EncodeToTokens(String, String, Boolean, Boolean) |
Codiert Eingabetext in eine Liste von EncodedTokens. (Geerbt von Tokenizer) |
| GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean) |
Suchen Sie den Index der maximalen Codierungskapazität von Anfang an innerhalb des Texts, ohne den Tokengrenzwert zu überschreiten. |
| GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Suchen Sie den Index der maximalen Codierungskapazität, ohne die Tokengrenze zu überschreiten. (Geerbt von Tokenizer) |
| GetIndexByTokenCount(String, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean) |
Suchen Sie den Index der maximalen Codierungskapazität von Anfang an innerhalb des Texts, ohne den Tokengrenzwert zu überschreiten. |
| GetIndexByTokenCount(String, Int32, String, Int32, Boolean, Boolean) |
Suchen Sie den Index der maximalen Codierungskapazität, ohne die Tokengrenze zu überschreiten. (Geerbt von Tokenizer) |
| GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32) |
Suchen Sie den Index der maximalen Codierungskapazität, ohne die Tokengrenze zu überschreiten. |
| GetIndexByTokenCountFromEnd(ReadOnlySpan<Char>, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean) |
Suchen Sie den Index der maximalen Codierungskapazität vom Ende des Texts, ohne den Tokengrenzwert zu überschreiten. |
| GetIndexByTokenCountFromEnd(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Suchen Sie den Index der maximalen Codierungskapazität, ohne die Tokengrenze zu überschreiten. (Geerbt von Tokenizer) |
| GetIndexByTokenCountFromEnd(String, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean) |
Suchen Sie den Index der maximalen Codierungskapazität vom Ende des Texts, ohne den Tokengrenzwert zu überschreiten. |
| GetIndexByTokenCountFromEnd(String, Int32, String, Int32, Boolean, Boolean) |
Suchen Sie den Index der maximalen Codierungskapazität, ohne die Tokengrenze zu überschreiten. (Geerbt von Tokenizer) |