CodeGenTokenizer.Create(Stream, Stream, Boolean, Boolean, Boolean) Metoda
Definicja
Ważne
Niektóre informacje odnoszą się do produktu w wersji wstępnej, który może zostać znacząco zmodyfikowany przed wydaniem. Firma Microsoft nie udziela żadnych gwarancji, jawnych lub domniemanych, w odniesieniu do informacji podanych w tym miejscu.
Utwórz tokenizator CodeGen na podstawie danego wywołania i scala strumienie.
public static Microsoft.ML.Tokenizers.CodeGenTokenizer Create(System.IO.Stream vocabStream, System.IO.Stream mergesStream, bool addPrefixSpace = false, bool addBeginOfSentence = false, bool addEndOfSentence = false);
static member Create : System.IO.Stream * System.IO.Stream * bool * bool * bool -> Microsoft.ML.Tokenizers.CodeGenTokenizer
Public Shared Function Create (vocabStream As Stream, mergesStream As Stream, Optional addPrefixSpace As Boolean = false, Optional addBeginOfSentence As Boolean = false, Optional addEndOfSentence As Boolean = false) As CodeGenTokenizer
Parametry
- vocabStream
- Stream
Strumień zawierający plik vocab.
- mergesStream
- Stream
Strumień zawierający plik scalania.
- addPrefixSpace
- Boolean
Określ, czy należy dodać spację przed tokenem.
- addBeginOfSentence
- Boolean
Wskazuje emitowanie początku tokenu zdania podczas kodowania.
- addEndOfSentence
- Boolean
Wskazuje emitowanie końca tokenu zdania podczas kodowania.
Zwraca
Obiekt tokenizer CodeGen.
Uwagi
Tokenizer zostanie utworzony zgodnie z konfiguracją określoną w https://huggingface.co/Salesforce/codegen-350M-mono/raw/main/tokenizer.json. Ważne jest, aby zapewnić podobne wywołanie i scala pliki z plikami używanymi w trenowaniu modelu. Wywołanie i scalanie plików można pobrać z następujących linków: https://huggingface.co/Salesforce/codegen-350M-mono/resolve/main/vocab.json?download=truehttps://huggingface.co/Salesforce/codegen-350M-mono/resolve/main/merges.txt?download=true Podczas tworzenia tokenizatora upewnij się, że strumień słownictwa pochodzi od zaufanego dostawcy.