Phi2Tokenizer Klasse
Definition
Wichtig
Einige Informationen beziehen sich auf Vorabversionen, die vor dem Release ggf. grundlegend überarbeitet werden. Microsoft übernimmt hinsichtlich der hier bereitgestellten Informationen keine Gewährleistungen, seien sie ausdrücklich oder konkludent.
Represent the Byte Pair Encoding model. Implementieren des in 2 beschriebenen Phi2-Tokenizers https://huggingface.co/microsoft/phi-2
public sealed class Phi2Tokenizer : Microsoft.ML.Tokenizers.CodeGenTokenizer
type Phi2Tokenizer = class
inherit CodeGenTokenizer
Public NotInheritable Class Phi2Tokenizer
Inherits CodeGenTokenizer
- Vererbung
Eigenschaften
| Name | Beschreibung |
|---|---|
| AddBeginningOfSentence |
Ruft das Flag ab, das angibt, ob der Anfang des Satztokens in die Codierung eingeschlossen werden soll. (Geerbt von CodeGenTokenizer) |
| AddEndOfSentence |
Ruft das Flag ab, das angibt, ob das Ende des Satztokens in die Codierung eingeschlossen werden soll. (Geerbt von CodeGenTokenizer) |
| AddPrefixSpace |
Ruft das Flag ab, das angibt, ob vor dem Codieren des Texts ein führendes Leerzeichen eingeschlossen werden soll. (Geerbt von CodeGenTokenizer) |
| BeginningOfSentenceId |
Ruft das Ende des Satztokens-ID ab. (Geerbt von CodeGenTokenizer) |
| BeginningOfSentenceToken |
Ruft den Anfang des Satztokens ab. (Geerbt von CodeGenTokenizer) |
| EndOfSentenceId |
Ruft das Ende des Satztokens-ID ab. (Geerbt von CodeGenTokenizer) |
| EndOfSentenceToken |
Ruft das Ende des Satztokens ab. (Geerbt von CodeGenTokenizer) |
| Normalizer |
Ruft den vom Tokenizer verwendeten Normalizer ab. (Geerbt von CodeGenTokenizer) |
| PreTokenizer |
Ruft das vom Tokenizer verwendete PreTokenizer ab. (Geerbt von CodeGenTokenizer) |
| SpecialTokens |
Ruft die hinzugefügten Token ab. (Geerbt von CodeGenTokenizer) |
| UnknownToken |
Das unbekannte Token. (Geerbt von CodeGenTokenizer) |
| UnknownTokenId |
Ruft die unbekannte Token-ID ab. (Geerbt von CodeGenTokenizer) |
| Vocabulary |
Ruft die Wörterbuchzuordnungstoken zu IDs ab. (Geerbt von CodeGenTokenizer) |
Methoden
| Name | Beschreibung |
|---|---|
| CountTokens(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, Boolean, Boolean) |
Rufen Sie die Anzahl der Token ab, für die der Eingabetext codiert wird. (Geerbt von CodeGenTokenizer) |
| CountTokens(ReadOnlySpan<Char>, Boolean, Boolean) |
Rufen Sie die Anzahl der Token ab, für die der Eingabetext codiert wird. (Geerbt von Tokenizer) |
| CountTokens(String, Boolean, Boolean, Boolean, Boolean, Boolean) |
Rufen Sie die Anzahl der Token ab, für die der Eingabetext codiert wird. (Geerbt von CodeGenTokenizer) |
| CountTokens(String, Boolean, Boolean) |
Rufen Sie die Anzahl der Token ab, für die der Eingabetext codiert wird. (Geerbt von Tokenizer) |
| CountTokens(String, ReadOnlySpan<Char>, EncodeSettings) |
Rufen Sie die Anzahl der Token ab, für die der Eingabetext codiert wird. (Geerbt von CodeGenTokenizer) |
| Create(Stream, Stream, Boolean, Boolean, Boolean) |
Erstellen Sie einen CodeGen Phi2-Tokenizer aus dem angegebenen vocab und führt Datenströme zusammen. |
| Decode(IEnumerable<Int32>, Boolean, Boolean) |
Decodieren Sie die angegebenen IDs zurück zu einer Zeichenfolge. (Geerbt von CodeGenTokenizer) |
| Decode(IEnumerable<Int32>, Span<Char>, Boolean, Boolean, Int32, Int32) |
Decodieren Sie die angegebenen IDs wieder in Text, und speichern Sie das Ergebnis in der |
| Decode(IEnumerable<Int32>, Span<Char>, Int32, Int32) |
Decodieren Sie die angegebenen IDs wieder in Text, und speichern Sie das Ergebnis in der |
| Decode(IEnumerable<Int32>) |
Decodieren Sie die angegebenen IDs zurück zu einer Zeichenfolge. (Geerbt von CodeGenTokenizer) |
| EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, Boolean, Boolean) |
Codiert Eingabetext in Token-IDs. (Geerbt von CodeGenTokenizer) |
| EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean) |
Codiert Eingabetext in Token-IDs. (Geerbt von Tokenizer) |
| EncodeToIds(ReadOnlySpan<Char>, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean) |
Codiert Eingabetext in Token-IDs bis zur maximalen Anzahl von Token. (Geerbt von CodeGenTokenizer) |
| EncodeToIds(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Codiert Eingabetext in Token-IDs bis zur maximalen Anzahl von Token. (Geerbt von Tokenizer) |
| EncodeToIds(String, Boolean, Boolean, Boolean, Boolean, Boolean) |
Codiert Eingabetext in Token-IDs. (Geerbt von CodeGenTokenizer) |
| EncodeToIds(String, Boolean, Boolean) |
Codiert Eingabetext in Token-IDs. (Geerbt von Tokenizer) |
| EncodeToIds(String, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean) |
Codiert Eingabetext in Token-IDs bis zur maximalen Anzahl von Token. (Geerbt von CodeGenTokenizer) |
| EncodeToIds(String, Int32, String, Int32, Boolean, Boolean) |
Codiert Eingabetext in Token-IDs bis zur maximalen Anzahl von Token. <param name="text">Der zu codierenden Text.</param> (Geerbt von Tokenizer) |
| EncodeToIds(String, ReadOnlySpan<Char>, EncodeSettings) |
Codiert Eingabetext in Token-IDs. (Geerbt von CodeGenTokenizer) |
| EncodeToTokens(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, String, Boolean, Boolean) |
Codiert Eingabetext für Objekt mit der Tokenliste, Token-IDs, Token-Offsetzuordnung. (Geerbt von CodeGenTokenizer) |
| EncodeToTokens(ReadOnlySpan<Char>, String, Boolean, Boolean) |
Codiert Eingabetext in eine Liste von EncodedTokens. (Geerbt von Tokenizer) |
| EncodeToTokens(String, Boolean, Boolean, Boolean, String, Boolean, Boolean) |
Codiert Eingabetext für Objekt mit der Tokenliste, Token-IDs, Token-Offsetzuordnung. (Geerbt von CodeGenTokenizer) |
| EncodeToTokens(String, ReadOnlySpan<Char>, EncodeSettings) |
Codiert Eingabetext in eine Liste von EncodedTokens. (Geerbt von CodeGenTokenizer) |
| EncodeToTokens(String, String, Boolean, Boolean) |
Codiert Eingabetext in eine Liste von EncodedTokens. (Geerbt von Tokenizer) |
| GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean) |
Suchen Sie den Index der maximalen Codierungskapazität von Anfang an innerhalb des Texts, ohne den Tokengrenzwert zu überschreiten. (Geerbt von CodeGenTokenizer) |
| GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Suchen Sie den Index der maximalen Codierungskapazität, ohne die Tokengrenze zu überschreiten. (Geerbt von Tokenizer) |
| GetIndexByTokenCount(String, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean) |
Suchen Sie den Index der maximalen Codierungskapazität von Anfang an innerhalb des Texts, ohne den Tokengrenzwert zu überschreiten. (Geerbt von CodeGenTokenizer) |
| GetIndexByTokenCount(String, Int32, String, Int32, Boolean, Boolean) |
Suchen Sie den Index der maximalen Codierungskapazität, ohne die Tokengrenze zu überschreiten. (Geerbt von Tokenizer) |
| GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32) |
Suchen Sie den Index der maximalen Codierungskapazität, ohne die Tokengrenze zu überschreiten. (Geerbt von CodeGenTokenizer) |
| GetIndexByTokenCountFromEnd(ReadOnlySpan<Char>, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean) |
Suchen Sie den Index der maximalen Codierungskapazität vom Ende des Texts, ohne den Tokengrenzwert zu überschreiten. (Geerbt von CodeGenTokenizer) |
| GetIndexByTokenCountFromEnd(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Suchen Sie den Index der maximalen Codierungskapazität, ohne die Tokengrenze zu überschreiten. (Geerbt von Tokenizer) |
| GetIndexByTokenCountFromEnd(String, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean) |
Suchen Sie den Index der maximalen Codierungskapazität vom Ende des Texts, ohne den Tokengrenzwert zu überschreiten. (Geerbt von CodeGenTokenizer) |
| GetIndexByTokenCountFromEnd(String, Int32, String, Int32, Boolean, Boolean) |
Suchen Sie den Index der maximalen Codierungskapazität, ohne die Tokengrenze zu überschreiten. (Geerbt von Tokenizer) |