UnicodeCategory Enumeráció
Definíció
Fontos
Egyes információk olyan, kiadás előtti termékekre vonatkoznak, amelyek a kiadásig még jelentősen módosulhatnak. A Microsoft nem vállal kifejezett vagy törvényi garanciát az itt megjelenő információért.
Egy karakter Unicode-kategóriáját határozza meg.
public enum class UnicodeCategory
public enum UnicodeCategory
[System.Serializable]
public enum UnicodeCategory
[System.Serializable]
[System.Runtime.InteropServices.ComVisible(true)]
public enum UnicodeCategory
type UnicodeCategory =
[<System.Serializable>]
type UnicodeCategory =
[<System.Serializable>]
[<System.Runtime.InteropServices.ComVisible(true)>]
type UnicodeCategory =
Public Enum UnicodeCategory
- Öröklődés
- Attribútumok
Mezők
| Name | Érték | Description |
|---|---|---|
| UppercaseLetter | 0 | Nagybetű. A "Lu" Unicode-jelöléssel (betű, nagybetű) jelölve. Az érték 0. |
| LowercaseLetter | 1 | Kisbetű. A Unicode "Ll" (betű, kisbetű) megjelölésével van aláírva. Az érték 1. |
| TitlecaseLetter | 2 | Címsor betűje. Az "Lt" Unicode-jelöléssel (betű, címhuzat) jelölve. Az érték 2. |
| ModifierLetter | 3 | Módosító betűjel, amely szabadon álló térköz karakter, amely az előző betű módosításait jelzi. Az "Lm" Unicode-jelölés (betű, módosító) jelöli. Az érték 3. |
| OtherLetter | 4 | Olyan betű, amely nem nagybetű, kisbetű, cím- vagy módosítóbetű. A "Lo" Unicode-jelöléssel (betű, egyéb) jelölve. Az érték 4. |
| NonSpacingMark | 5 | Nem látható karakter, amely egy alapkarakte módosítására utal. Az "Mn" Unicode-jelöléssel (megjelölés, nem megjelölés) jelölve. Az érték 5. |
| SpacingCombiningMark | 6 | Térköz karakter, amely az alapkaraktér módosítását jelzi, és befolyásolja az alap karakter karakterének szélességét. Az "Mc" Unicode-jelöléssel (jel, térköz egyesítésével) jelölve. Az érték 6. |
| EnclosingMark | 7 | Jelkarakter beágyazása, amely egy nem összefűzhető karakter, amely az összes korábbi karaktert egy alapkarakterig veszi körül. A "Me" Unicode-jelöléssel (megjelölés, belefoglalás) jelölve. Az érték 7. |
| DecimalDigitNumber | 8 | Tizedesjegy karakter, azaz a 0 és 9 közötti tartomány egészét képviselő karakter. Az "Nd" Unicode-jelöléssel (szám, tizedesjegy) jelölve. Az érték 8. |
| LetterNumber | 9 | Szám betűvel jelölve, tizedesjegy helyett, például az öthöz tartozó római szám, amely "V". A mutatót az "Nl" Unicode-jelölés (szám, betű) jelöli. Az érték 9. |
| OtherNumber | 10 | Szám, amely nem tizedesjegy, sem betűszám, például 1/2 tört. A mutatót a Unicode "Nem" (szám, egyéb) megjelölése jelöli. Az érték 10. |
| SpaceSeparator | 11 | Szóköz karakter, amely nem rendelkezik karakterjeltel, de nem vezérlőelem- vagy formátumkarakter. A "Zs" Unicode-jelöléssel (elválasztó, szóköz) jelölve. Az érték 11. |
| LineSeparator | 12 | Szövegsorok elválasztására használt karakter. A Unicode "Zl" (elválasztó, vonal) megjelölésével van aláírva. Az érték 12. |
| ParagraphSeparator | 13 | Bekezdések elválasztásához használt karakter. A Unicode "Zp" (elválasztó, bekezdés) megjelölésével van aláírva. Az érték 13. |
| Control | 14 | Vezérlőkód karakter U+007F Unicode-értékkel, vagy U+0000 és U+001F közötti tartományban vagy U+0080 és U+009F között. A Unicode "Cc" (más, vezérlő) megjelölésével van aláírva. Az érték 14. |
| Format | 15 | Formázási karakter, amely hatással van a szöveg elrendezésére vagy a szövegfolyamatok működésére, de általában nem jelenik meg. A Unicode "Cf" (más, formátum) megjelölésével van aláírva. Az érték 15. |
| Surrogate | 16 | Magas helyettesítő vagy alacsony helyettesítő karakter. A helyettesítő kód értékei az U+D800 és az U+DFFF tartományba tartoznak. A Unicode "Cs" (más, helyettesítő) megjelölésével van aláírva. Az érték 16. |
| PrivateUse | 17 | Privát használatú karakter, unicode-értékkel az U+E000 és U+F8FF tartományban. A "Co" Unicode-jelöléssel (egyéb, privát használat) jelölve. Az érték 17. |
| ConnectorPunctuation | 18 | Összekötő írásjele, amely két karaktert kapcsol össze. A "Pc" Unicode-jelöléssel (írásjel, összekötő) jelölve. Az érték 18. |
| DashPunctuation | 19 | Kötőjel vagy kötőjel karakter. A Unicode "Pd" (írásjel, kötőjel) megjelölésével van aláírva. Az érték 19. |
| OpenPunctuation | 20 | Az egyik párosított írásjel nyitó karaktere, például zárójelek, szögletes zárójelek és zárójelek. A "Ps" Unicode-jelöléssel (írásjelezés, megnyitás) jelölve. Az érték 20. |
| ClosePunctuation | 21 | Az egyik párosított írásjel záró karaktere, például zárójelek, szögletes zárójelek és zárójelek. A "Pe" Unicode-jelölés (írásjel, bezárás) jelzi. Az érték 21. |
| InitialQuotePunctuation | 22 | Nyitó vagy kezdeti idézőjel karakter. A "Pi" Unicode-jelöléssel (írásjel, kezdeti idézőjel) jelölve. Az érték 22. |
| FinalQuotePunctuation | 23 | Záró vagy záró idézőjel karakter. A "Pf" Unicode-jelöléssel (írásjel, záró idézőjel) jelölve. Az érték 23. |
| OtherPunctuation | 24 | Írásjel, amely nem összekötő, kötőjel, nyitott írásjel, írásjel bezárása, kezdeti idézőjel vagy záró idézőjel. A "Po" Unicode-jelöléssel (írásjel, egyéb) jelölve. Az érték 24. |
| MathSymbol | 25 | Matematikai szimbólum karakter, például "+" vagy "= ". "Sm" (szimbólum, matematika) Unicode-jelöléssel jelölve. Az érték 25. |
| CurrencySymbol | 26 | Pénznem szimbólum karaktere. Az "Sc" Unicode-jelöléssel (szimbólum, pénznem) jelölve. Az érték 26. |
| ModifierSymbol | 27 | Módosító szimbólum karakter, amely a környező karakterek módosítását jelzi. A tört perjel például azt jelzi, hogy a bal oldali szám a számláló, a jobb oldalon pedig a nevező. A mutatót a Unicode "Sk" (szimbólum, módosító) megjelölése jelöli. Az érték 27. |
| OtherSymbol | 28 | Nem matematikai szimbólum, pénznemszimbólum vagy módosító szimbólum. "So" Unicode-jelöléssel (szimbólum, egyéb) jelölve. Az érték 28. |
| OtherNotAssigned | 29 | Olyan karakter, amely nincs Unicode-kategóriához rendelve. A Unicode "Cn" (más, nem hozzárendelt) megjelölésével van aláírva. Az érték 29. |
Példák
Az alábbi példa a Nagybetűs kategóriában szereplő karaktereket és a hozzájuk tartozó kódpontokat jeleníti meg. A példát úgy módosíthatja, hogy bármely más kategóriában megjelenítse a betűket úgy, hogy a nagybetűket a változóhoz való hozzárendelésben az Önt érdeklő kategóriára category cseréli. Vegye figyelembe, hogy egyes kategóriák kimenete kiterjedt lehet.
using System;
using System.Globalization;
public class Example
{
public static void Main()
{
int ctr = 0;
UnicodeCategory category = UnicodeCategory.UppercaseLetter;
for (ushort codePoint = 0; codePoint < ushort.MaxValue; codePoint++) {
Char ch = (char)codePoint;
if (CharUnicodeInfo.GetUnicodeCategory(ch) == category) {
if (ctr % 5 == 0)
Console.WriteLine();
Console.Write("{0} (U+{1:X4}) ", ch, codePoint);
ctr++;
}
}
Console.WriteLine();
Console.WriteLine("\n{0} characters are in the {1:G} category",
ctr, category);
}
}
Imports System.Globalization
Module Example
Public Sub Main()
Dim ctr As Integer = 0
Dim category As UnicodeCategory = UnicodeCategory.UppercaseLetter
For codePoint As UShort = 0 To UShort.MaxValue - 1
Dim ch As Char = Convert.ToChar(codePoint)
If CharUnicodeInfo.GetUnicodeCategory(ch) = category Then
If ctr Mod 5 = 0 Then Console.WriteLine()
Console.Write("{0} (U+{1:X4}) ", ch, codePoint)
ctr += 1
End If
Next
Console.WriteLine()
Console.WriteLine()
Console.WriteLine("{0} characters are in the {1:G} category",
ctr, category)
End Sub
End Module
Megjegyzések
Az enumerálás egy tagját UnicodeCategory a Char.GetUnicodeCategory metódusok adják CharUnicodeInfo.GetUnicodeCategory vissza. Az UnicodeCategory enumerálás olyan metódusok támogatására Char is használható, mint a IsUpper(Char). Ezek a metódusok határozzák meg, hogy egy adott karakter egy adott Unicode-általános kategória tagja-e. A Unicode általános kategóriája határozza meg egy karakter széles körű besorolását, azaz a betűtípusként, tizedesjegyként, elválasztóként, matematikai szimbólumként, írásjelként stb. való megjelölést.
Ez az enumerálás a Unicode Standard 5.0-s verzióján alapul. További információ: "UCD fájlformátum" és "Általános kategóriaértékek" altopika a Unicode karakteradatbázisban.
A Unicode Standard a következőket határozza meg:
A helyettesítő pár egy kódolt karakterábrázolás egyetlen absztrakt karakterhez, amely két kódegységből álló sorozatból áll, ahol a pár első egysége magas helyettesítő, a második pedig alacsony helyettes. A magas helyettesítő egy Unicode kódpont az U+D800 és U+DBFF közötti tartományban, az alacsony helyettesítő pedig egy Unicode kódpont az U+DC00 és az U+DFFF tartományban.
Az egyesítő karaktersorozatok egy alapkarakterek és egy vagy több egyesítési karakter kombinációját használják. A helyettesítő párok egy alap- vagy egyesítési karaktert jelölnek. Az egyesítő karakterek térközök vagy nem láthatók. A térköz-egyesítési karakterek a rendereléskor önmagukban is térközt foglalnak el, míg a nem konkretáló egyesítési karakterek nem. A mellékjelek a karakterek nem szemléltetését szemléltetik.
A módosító betű egy szabadon álló térköz karakter, amely az egyesítő karakterhez hasonlóan az előző betű módosításait jelzi.
A befoglalójelek olyan nem összefűzendő karakterek, amelyek az összes korábbi karaktert egy alapkarakterig veszik körül.
A formázási karakterek olyan karakterek, amelyek általában nem jelennek meg, de hatással van a szöveg elrendezésére vagy a szövegfolyamatok működésére.
A Unicode Standard több változatot is meghatároz néhány írásjelre. Egy kötőjel lehet például egy kötőjelet képviselő kódérték egyike, például U+002D (kötőjel mínusz) vagy U+00AD (puha kötőjel) vagy U+2010 (kötőjel) vagy U+2011 (nem törhető kötőjel). Ugyanez igaz a kötőjelekre, szóközökre és idézőjelekre is.
A Unicode Standard emellett kódokat rendel egy adott szkripthez vagy nyelvhez tartozó decimális számjegyek ábrázolásához, például U+0030 (nulla számjegy) és U+0660 (Arabic-Indic nulla számjegy).