語言

Phi2Tokenizer 類別

定義

表示位元組對編碼模型。 實作描述的 Phi2 分詞器 https://huggingface.co/microsoft/phi-2

public sealed class Phi2Tokenizer : Microsoft.ML.Tokenizers.CodeGenTokenizer
type Phi2Tokenizer = class
    inherit CodeGenTokenizer
Public NotInheritable Class Phi2Tokenizer
Inherits CodeGenTokenizer
繼承

屬性

名稱 Description
AddBeginningOfSentence

取得指示是否在編碼中包含句子開頭符號的旗標。

(繼承來源 CodeGenTokenizer)
AddEndOfSentence

取得指示是否包含句尾標記的旗標。

(繼承來源 CodeGenTokenizer)
AddPrefixSpace

會取得指示是否在編碼文字前加入導引空格的旗標。

(繼承來源 CodeGenTokenizer)
BeginningOfSentenceId

會拿到句尾的 Token ID。

(繼承來源 CodeGenTokenizer)
BeginningOfSentenceToken

取得句子標記的開頭。

(繼承來源 CodeGenTokenizer)
EndOfSentenceId

會拿到句尾的 Token ID。

(繼承來源 CodeGenTokenizer)
EndOfSentenceToken

會拿到句尾的標記。

(繼承來源 CodeGenTokenizer)
Normalizer

讓 Tokenizer 使用正規化器。

(繼承來源 CodeGenTokenizer)
PreTokenizer

取得分幣器使用的預分組器。

(繼承來源 CodeGenTokenizer)
SpecialTokens

獲得額外的代幣。

(繼承來源 CodeGenTokenizer)
UnknownToken

未知的標記。

(繼承來源 CodeGenTokenizer)
UnknownTokenId

取得未知的標記 ID。

(繼承來源 CodeGenTokenizer)
Vocabulary

取得字典將標記映射到 ID。

(繼承來源 CodeGenTokenizer)

方法

名稱 Description
CountTokens(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, Boolean, Boolean)

取得輸入文字將被編碼的標記數量。

(繼承來源 CodeGenTokenizer)
CountTokens(ReadOnlySpan<Char>, Boolean, Boolean)

取得輸入文字將被編碼的標記數量。

(繼承來源 Tokenizer)
CountTokens(String, Boolean, Boolean, Boolean, Boolean, Boolean)

取得輸入文字將被編碼的標記數量。

(繼承來源 CodeGenTokenizer)
CountTokens(String, Boolean, Boolean)

取得輸入文字將被編碼的標記數量。

(繼承來源 Tokenizer)
CountTokens(String, ReadOnlySpan<Char>, EncodeSettings)

取得輸入文字將被編碼的標記數量。

(繼承來源 CodeGenTokenizer)
Create(Stream, Stream, Boolean, Boolean, Boolean)

從給定的詞彙建立一個 CodeGen Phi2 分詞器,然後合併串流。

Decode(IEnumerable<Int32>, Boolean, Boolean)

將給定的 id 解碼回字串。

(繼承來源 CodeGenTokenizer)
Decode(IEnumerable<Int32>, Span<Char>, Boolean, Boolean, Int32, Int32)

將給定的 id 解碼回文字,並將結果儲存在該 destination 區間。

(繼承來源 CodeGenTokenizer)
Decode(IEnumerable<Int32>, Span<Char>, Int32, Int32)

將給定的 id 解碼回文字,並將結果儲存在該 destination 區間。

(繼承來源 CodeGenTokenizer)
Decode(IEnumerable<Int32>)

將給定的 id 解碼回字串。

(繼承來源 CodeGenTokenizer)
EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, Boolean, Boolean)

將輸入文字編碼為 Ids。

(繼承來源 CodeGenTokenizer)
EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean)

將輸入文字編碼為標記 ID。

(繼承來源 Tokenizer)
EncodeToIds(ReadOnlySpan<Char>, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

將輸入文字編碼為標記 Id,最多可達標記數量。

(繼承來源 CodeGenTokenizer)
EncodeToIds(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

將輸入文字編碼為標記 ID,最多可達最大標記數。

(繼承來源 Tokenizer)
EncodeToIds(String, Boolean, Boolean, Boolean, Boolean, Boolean)

將輸入文字編碼為 Ids。

(繼承來源 CodeGenTokenizer)
EncodeToIds(String, Boolean, Boolean)

將輸入文字編碼為標記 ID。

(繼承來源 Tokenizer)
EncodeToIds(String, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

將輸入文字編碼為標記 Id,最多可達標記數量。

(繼承來源 CodeGenTokenizer)
EncodeToIds(String, Int32, String, Int32, Boolean, Boolean)

將輸入文字編碼為標記 ID,最多可達最大標記數。

<param name=“text”> 要編碼的文字。</param> (繼承來源 Tokenizer)
EncodeToIds(String, ReadOnlySpan<Char>, EncodeSettings)

將輸入文字編碼為標記 ID。

(繼承來源 CodeGenTokenizer)
EncodeToTokens(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, String, Boolean, Boolean)

將輸入文字編碼為物件,包含標記列表、標記 Id、標記偏移映射。

(繼承來源 CodeGenTokenizer)
EncodeToTokens(ReadOnlySpan<Char>, String, Boolean, Boolean)

將輸入文字編碼為一串 EncodedTokens 的列表。

(繼承來源 Tokenizer)
EncodeToTokens(String, Boolean, Boolean, Boolean, String, Boolean, Boolean)

將輸入文字編碼為物件,包含標記列表、標記 Id、標記偏移映射。

(繼承來源 CodeGenTokenizer)
EncodeToTokens(String, ReadOnlySpan<Char>, EncodeSettings)

將輸入文字編碼為一串 EncodedTokens 的列表。

(繼承來源 CodeGenTokenizer)
EncodeToTokens(String, String, Boolean, Boolean)

將輸入文字編碼為一串 EncodedTokens 的列表。

(繼承來源 Tokenizer)
GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

從文字開始時,找出最大編碼容量的索引,且不超過令牌限制。

(繼承來源 CodeGenTokenizer)
GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

找出最大編碼容量的索引,且不超過令牌限制。

(繼承來源 Tokenizer)
GetIndexByTokenCount(String, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

從文字開始時,找出最大編碼容量的索引,且不超過令牌限制。

(繼承來源 CodeGenTokenizer)
GetIndexByTokenCount(String, Int32, String, Int32, Boolean, Boolean)

找出最大編碼容量的索引,且不超過令牌限制。

(繼承來源 Tokenizer)
GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32)

找出最大編碼容量的索引,且不超過令牌限制。

(繼承來源 CodeGenTokenizer)
GetIndexByTokenCountFromEnd(ReadOnlySpan<Char>, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

找出從文字末尾最大編碼容量的索引,且不超過標記限制。

(繼承來源 CodeGenTokenizer)
GetIndexByTokenCountFromEnd(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

找出最大編碼容量的索引,且不超過令牌限制。

(繼承來源 Tokenizer)
GetIndexByTokenCountFromEnd(String, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

找出從文字末尾最大編碼容量的索引,且不超過標記限制。

(繼承來源 CodeGenTokenizer)
GetIndexByTokenCountFromEnd(String, Int32, String, Int32, Boolean, Boolean)

找出最大編碼容量的索引,且不超過令牌限制。

(繼承來源 Tokenizer)

適用於