Język

CodeGenTokenizer Klasa

Definicja

Reprezentuje model kodowania par bajtów. Implementowanie tokenizatora CodeGen opisanego w temacie https://huggingface.co/docs/transformers/main/en/model_doc/codegen#overview

public class CodeGenTokenizer : Microsoft.ML.Tokenizers.Tokenizer
type CodeGenTokenizer = class
    inherit Tokenizer
Public Class CodeGenTokenizer
Inherits Tokenizer
Dziedziczenie
CodeGenTokenizer
Pochodne

Właściwości

Nazwa Opis
AddBeginningOfSentence

Pobiera flagę wskazującą, czy dołączyć początek tokenu zdania do kodowania.

AddEndOfSentence

Pobiera flagę wskazującą, czy w kodowaniu należy uwzględnić koniec tokenu zdania.

AddPrefixSpace

Pobiera flagę wskazującą, czy przed kodowaniem tekstu należy uwzględnić spację wiodącą.

BeginningOfSentenceId

Pobiera koniec identyfikatora tokenu zdania.

BeginningOfSentenceToken

Pobiera początek tokenu zdania.

EndOfSentenceId

Pobiera koniec identyfikatora tokenu zdania.

EndOfSentenceToken

Pobiera koniec tokenu zdania.

Normalizer

Pobiera moduł normalizer używany przez tokenizator.

PreTokenizer

Pobiera pretokenizer używany przez tokenizator.

SpecialTokens

Pobiera dodane tokeny.

UnknownToken

Nieznany token.

UnknownTokenId

Pobiera nieznany identyfikator tokenu.

Vocabulary

Pobiera tokeny mapowania słownika na identyfikatory.

Metody

Nazwa Opis
CountTokens(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, Boolean, Boolean)

Pobierz liczbę tokenów, do których zostanie zakodowany tekst wejściowy.

CountTokens(ReadOnlySpan<Char>, Boolean, Boolean)

Pobierz liczbę tokenów, do których zostanie zakodowany tekst wejściowy.

(Odziedziczone po Tokenizer)
CountTokens(String, Boolean, Boolean, Boolean, Boolean, Boolean)

Pobierz liczbę tokenów, do których zostanie zakodowany tekst wejściowy.

CountTokens(String, Boolean, Boolean)

Pobierz liczbę tokenów, do których zostanie zakodowany tekst wejściowy.

(Odziedziczone po Tokenizer)
CountTokens(String, ReadOnlySpan<Char>, EncodeSettings)

Pobierz liczbę tokenów, do których zostanie zakodowany tekst wejściowy.

Create(Stream, Stream, Boolean, Boolean, Boolean)

Utwórz tokenizator CodeGen na podstawie danego wywołania i scala strumienie.

Decode(IEnumerable<Int32>, Boolean, Boolean)

Zdekoduj podane identyfikatory z powrotem do ciągu.

Decode(IEnumerable<Int32>, Span<Char>, Boolean, Boolean, Int32, Int32)

Zdekoduj podane identyfikatory z powrotem do tekstu i zapisz wynik w destination zakresie.

Decode(IEnumerable<Int32>, Span<Char>, Int32, Int32)

Zdekoduj podane identyfikatory z powrotem do tekstu i zapisz wynik w destination zakresie.

Decode(IEnumerable<Int32>)

Zdekoduj podane identyfikatory z powrotem do ciągu.

EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, Boolean, Boolean)

Koduje tekst wejściowy do identyfikatorów tokenów.

EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean)

Koduje tekst wejściowy do identyfikatorów tokenu.

(Odziedziczone po Tokenizer)
EncodeToIds(ReadOnlySpan<Char>, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

Koduje tekst wejściowy do identyfikatorów tokenów do maksymalnej liczby tokenów.

EncodeToIds(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

Koduje tekst wejściowy do identyfikatorów tokenu do maksymalnej liczby tokenów.

(Odziedziczone po Tokenizer)
EncodeToIds(String, Boolean, Boolean, Boolean, Boolean, Boolean)

Koduje tekst wejściowy do identyfikatorów tokenów.

EncodeToIds(String, Boolean, Boolean)

Koduje tekst wejściowy do identyfikatorów tokenu.

(Odziedziczone po Tokenizer)
EncodeToIds(String, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

Koduje tekst wejściowy do identyfikatorów tokenów do maksymalnej liczby tokenów.

EncodeToIds(String, Int32, String, Int32, Boolean, Boolean)

Koduje tekst wejściowy do identyfikatorów tokenu do maksymalnej liczby tokenów.

<param name="text">Tekst do zakodowania.</param> (Odziedziczone po Tokenizer)
EncodeToIds(String, ReadOnlySpan<Char>, EncodeSettings)

Koduje tekst wejściowy do identyfikatorów tokenu.

EncodeToTokens(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, String, Boolean, Boolean)

Koduje tekst wejściowy do obiektu zawiera listę tokenów, identyfikatory tokenów, mapowanie przesunięcia tokenów.

EncodeToTokens(ReadOnlySpan<Char>, String, Boolean, Boolean)

Koduje tekst wejściowy do listy EncodedTokens.

(Odziedziczone po Tokenizer)
EncodeToTokens(String, Boolean, Boolean, Boolean, String, Boolean, Boolean)

Koduje tekst wejściowy do obiektu zawiera listę tokenów, identyfikatory tokenów, mapowanie przesunięcia tokenów.

EncodeToTokens(String, ReadOnlySpan<Char>, EncodeSettings)

Koduje tekst wejściowy do listy EncodedTokens.

EncodeToTokens(String, String, Boolean, Boolean)

Koduje tekst wejściowy do listy EncodedTokens.

(Odziedziczone po Tokenizer)
GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

Znajdź indeks maksymalnej pojemności kodowania od początku tekstu bez przekroczenia limitu tokenu.

GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

Znajdź indeks maksymalnej pojemności kodowania bez przekraczania limitu tokenu.

(Odziedziczone po Tokenizer)
GetIndexByTokenCount(String, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

Znajdź indeks maksymalnej pojemności kodowania od początku tekstu bez przekroczenia limitu tokenu.

GetIndexByTokenCount(String, Int32, String, Int32, Boolean, Boolean)

Znajdź indeks maksymalnej pojemności kodowania bez przekraczania limitu tokenu.

(Odziedziczone po Tokenizer)
GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32)

Znajdź indeks maksymalnej pojemności kodowania bez przekraczania limitu tokenu.

GetIndexByTokenCountFromEnd(ReadOnlySpan<Char>, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

Znajdź indeks maksymalnej pojemności kodowania z końca tekstu bez przekraczania limitu tokenu.

GetIndexByTokenCountFromEnd(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

Znajdź indeks maksymalnej pojemności kodowania bez przekraczania limitu tokenu.

(Odziedziczone po Tokenizer)
GetIndexByTokenCountFromEnd(String, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

Znajdź indeks maksymalnej pojemności kodowania z końca tekstu bez przekraczania limitu tokenu.

GetIndexByTokenCountFromEnd(String, Int32, String, Int32, Boolean, Boolean)

Znajdź indeks maksymalnej pojemności kodowania bez przekraczania limitu tokenu.

(Odziedziczone po Tokenizer)

Dotyczy