CodeGenTokenizer.GetIndexByTokenCount Methode

Definition

Überlädt

Name Beschreibung
GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

Suchen Sie den Index der maximalen Codierungskapazität von Anfang an innerhalb des Texts, ohne den Tokengrenzwert zu überschreiten.

GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32)

Suchen Sie den Index der maximalen Codierungskapazität, ohne die Tokengrenze zu überschreiten.

GetIndexByTokenCount(String, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

Suchen Sie den Index der maximalen Codierungskapazität von Anfang an innerhalb des Texts, ohne den Tokengrenzwert zu überschreiten.

GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

Quelle:
CodeGenTokenizer.cs
Quelle:
CodeGenTokenizer.cs
Quelle:
CodeGenTokenizer.cs

Suchen Sie den Index der maximalen Codierungskapazität von Anfang an innerhalb des Texts, ohne den Tokengrenzwert zu überschreiten.

public int GetIndexByTokenCount(ReadOnlySpan<char> text, int maxTokenCount, bool addPrefixSpace, bool addBeginningOfSentence, bool addEndOfSentence, out string? normalizedText, out int tokenCount, bool considerPreTokenization = true, bool considerNormalization = true);
override this.GetIndexByTokenCount : ReadOnlySpan<char> * int * bool * bool * bool * string * int * bool * bool -> int
Public Function GetIndexByTokenCount (text As ReadOnlySpan(Of Char), maxTokenCount As Integer, addPrefixSpace As Boolean, addBeginningOfSentence As Boolean, addEndOfSentence As Boolean, ByRef normalizedText As String, ByRef tokenCount As Integer, Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As Integer

Parameter

text
ReadOnlySpan<Char>

Der zu codierenden Text.

maxTokenCount
Int32

Die maximale Tokenanzahl, um die Codierungskapazität zu begrenzen.

addPrefixSpace
Boolean

Geben Sie an, ob vor dem Codieren des Texts ein führendes Leerzeichen eingeschlossen werden soll.

addBeginningOfSentence
Boolean

Geben Sie an, ob der Anfang des Satztokens in die Codierung eingeschlossen werden soll.

addEndOfSentence
Boolean

Geben Sie an, ob das Ende des Satztokens in die Codierung eingeschlossen werden soll.

normalizedText
String

Wenn die Normalisierung des Tokenizers aktiviert ist, wird der Eingabetext in seiner Normalisierungsform dargestellt. andernfalls ist er NULL.

tokenCount
Int32

Die Tokenanzahl kann generiert werden, die kleiner als die maximale Tokenanzahl sein soll.

considerPreTokenization
Boolean

Geben Sie an, ob vor der Tokenisierung vor der Tokenisierung berücksichtigt werden soll.

considerNormalization
Boolean

Geben Sie an, ob die Normalisierung vor der Tokenisierung berücksichtigt werden soll.

Gibt zurück

Der Index der maximalen Codierungskapazität innerhalb des verarbeiteten Texts, ohne den Tokengrenzwert zu überschreiten. Er stellt den Index unmittelbar nach dem letzten zeichen dar, das eingeschlossen werden soll. In Fällen, in denen keine Token passen, lautet das Ergebnis 0; wenn alle Token passen, entspricht das Ergebnis der Länge des Texts oder der normalizedText Aktivierung der Normalisierung.

Gilt für:

GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32)

Quelle:
CodeGenTokenizer.cs
Quelle:
CodeGenTokenizer.cs
Quelle:
CodeGenTokenizer.cs

Suchen Sie den Index der maximalen Codierungskapazität, ohne die Tokengrenze zu überschreiten.

protected override int GetIndexByTokenCount(string? text, ReadOnlySpan<char> textSpan, Microsoft.ML.Tokenizers.EncodeSettings settings, bool fromEnd, out string? normalizedText, out int tokenCount);
override this.GetIndexByTokenCount : string * ReadOnlySpan<char> * Microsoft.ML.Tokenizers.EncodeSettings * bool * string * int -> int
Protected Overrides Function GetIndexByTokenCount (text As String, textSpan As ReadOnlySpan(Of Char), settings As EncodeSettings, fromEnd As Boolean, ByRef normalizedText As String, ByRef tokenCount As Integer) As Integer

Parameter

text
String

Der zu codierenden Text.

textSpan
ReadOnlySpan<Char>

Der Bereich des zu codierenden Texts, der verwendet wird, wenn dies der text Grund ist null.

settings
EncodeSettings

Die Einstellungen, die zum Codieren des Texts verwendet werden.

fromEnd
Boolean

Geben Sie an, ob der Index vom Ende des Texts gesucht werden soll.

normalizedText
String

Wenn die Normalisierung des Tokenizers aktiviert ist oder <paramRef name="settings"></paramRef> has ConsiderNormalization is, falsethis will be set to <paramRef name="text"></paramRef> in its normalized form; otherwise, this value will be set to null.

tokenCount
Int32

Die Tokenanzahl kann generiert werden, die kleiner als die maximale Tokenanzahl sein soll.

Gibt zurück

Der Index der maximalen Codierungskapazität innerhalb des verarbeiteten Texts, ohne den Tokengrenzwert zu überschreiten. Wenn <paramRef name="fromEnd"></paramRef> is false, it represents the index immediately following the last character to be included. In Fällen, in denen keine Token passen, lautet das Ergebnis 0; Wenn alle Token passen, entspricht das Ergebnis der Länge des Eingabetexts oder der normalizedText Aktivierung der Normalisierung. Wenn <paramRef name="fromEnd"></paramRef> ist true, stellt sie den Index des ersten zeichens dar, das eingeschlossen werden soll. In Fällen, in denen keine Token passen, ist das Ergebnis die Textlänge; Umgekehrt, wenn alle Token passen, ist das Ergebnis null.

Gilt für:

GetIndexByTokenCount(String, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

Quelle:
CodeGenTokenizer.cs
Quelle:
CodeGenTokenizer.cs
Quelle:
CodeGenTokenizer.cs

Suchen Sie den Index der maximalen Codierungskapazität von Anfang an innerhalb des Texts, ohne den Tokengrenzwert zu überschreiten.

public int GetIndexByTokenCount(string text, int maxTokenCount, bool addPrefixSpace, bool addBeginningOfSentence, bool addEndOfSentence, out string? normalizedText, out int tokenCount, bool considerPreTokenization = true, bool considerNormalization = true);
override this.GetIndexByTokenCount : string * int * bool * bool * bool * string * int * bool * bool -> int
Public Function GetIndexByTokenCount (text As String, maxTokenCount As Integer, addPrefixSpace As Boolean, addBeginningOfSentence As Boolean, addEndOfSentence As Boolean, ByRef normalizedText As String, ByRef tokenCount As Integer, Optional considerPreTokenization As Boolean = true, Optional considerNormalization As Boolean = true) As Integer

Parameter

text
String

Der zu codierenden Text.

maxTokenCount
Int32

Die maximale Tokenanzahl, um die Codierungskapazität zu begrenzen.

addPrefixSpace
Boolean

Geben Sie an, ob vor dem Codieren des Texts ein führendes Leerzeichen eingeschlossen werden soll.

addBeginningOfSentence
Boolean

Geben Sie an, ob der Anfang des Satztokens in die Codierung eingeschlossen werden soll.

addEndOfSentence
Boolean

Geben Sie an, ob das Ende des Satztokens in die Codierung eingeschlossen werden soll.

normalizedText
String

Wenn die Normalisierung des Tokenizers aktiviert ist, wird der Eingabetext in seiner Normalisierungsform dargestellt. andernfalls ist er NULL.

tokenCount
Int32

Die Tokenanzahl kann generiert werden, die kleiner als die maximale Tokenanzahl sein soll.

considerPreTokenization
Boolean

Geben Sie an, ob vor der Tokenisierung vor der Tokenisierung berücksichtigt werden soll.

considerNormalization
Boolean

Geben Sie an, ob die Normalisierung vor der Tokenisierung berücksichtigt werden soll.

Gibt zurück

Der Index der maximalen Codierungskapazität innerhalb des verarbeiteten Texts, ohne den Tokengrenzwert zu überschreiten. Er stellt den Index unmittelbar nach dem letzten zeichen dar, das eingeschlossen werden soll. In Fällen, in denen keine Token passen, lautet das Ergebnis 0; wenn alle Token passen, entspricht das Ergebnis der Länge des Texts oder der normalizedText Aktivierung der Normalisierung.

Gilt für: