کتابخانه‌ی استاندارد · متن

یونیکد unicode

اطلاعات یونیکد درباره‌ی هر نویسه: دسته، خط، جهت نوشتن، حروف بزرگ و کوچک، تجزیه و ترکیب.

واردسازی یونیکد

یونیکد به هر نویسه‌ی همه‌ی خط‌های دنیا یک عدد داده که به آن «کدنقطه» می‌گویند؛ «ش» عدد ۱۵۸۸ است و «A» عدد ۶۵. بسته‌ی یونیکد برای هر کدنقطه می‌گوید چه نوع نویسه‌ای است: حرف است یا رقم، از کدام خط است، از راست به چپ نوشته می‌شود یا از چپ به راست، و شکل بزرگ یا کوچکش چیست.

بیشتر وقت‌ها روال‌های بسته‌ی رشته کافی‌اند و خودشان از همین بسته استفاده می‌کنند. این بسته برای وقتی است که خودتان متن را نویسه به نویسه بررسی می‌کنید؛ مثلاً در یک تجزیه‌گر، یک ویرایشگر یا ابزاری برای پاک‌سازی متن فارسی. داده‌ها از پایگاه داده‌ی رسمی یونیکد، نسخه‌ی ۱۶، ساخته شده‌اند.

برای گرفتن کدنقطه‌های یک رشته، رشته.کدنقطه ها را به کار ببرید.

پایاها و متغیرها

نیم فاصله ZWNJ

پایا نیم فاصله: صحیح۳۲ = 8204
کدنقطه‌ی نیم‌فاصله (U+200C)، که در فارسی دو حرف را کنار هم نگه می‌دارد بی‌آن‌که به هم بچسبند؛ مثل «می‌روم».
unicode-ZWNJ.salam
واردسازی یونیکد

روال ریشه:
    سرچاپ یونیکد.نیم فاصله، یونیکد.پیونددهنده بی عرض، یونیکد.بیشترین کدنقطه
    سرچاپ "یونیکد", یونیکد.نسخه
پایان
خروجی8204 8205 1114111 یونیکد 16.0.0

پیونددهنده بی عرض ZWJ

پایا پیونددهنده بی عرض: صحیح۳۲ = 8205
کدنقطه‌ی پیونددهنده‌ی بی‌عرض (U+200D)، که دو نویسه را به هم می‌چسباند؛ شکلک‌های ترکیبی مثل خانواده با آن ساخته می‌شوند.

نمونه‌ی این مورد همراه با موارد بالاتر آمده است: unicode-ZWNJ.salam

بیشترین کدنقطه MaxCodePoint

پایا بیشترین کدنقطه: صحیح۳۲ = 1114111
بزرگ‌ترین کدنقطه‌ی ممکن در یونیکد (0x10FFFF).

نمونه‌ی این مورد همراه با موارد بالاتر آمده است: unicode-ZWNJ.salam

ثابت‌های هجای هانگول Hangul…

عددهایی که برای ساختن و شکستن هجاهای کره‌ای (هانگول) با حساب لازم‌اند. هر هجا از یک صامت آغازی، یک مصوت و شاید یک صامت پایانی ساخته می‌شود و کدنقطه‌اش را می‌توان مستقیم حساب کرد.
نامانگلیسیمقدار
پایه هجای هانگولHangulSBase44032
پایه صامت آغازی هانگولHangulLBase4352
پایه مصوت هانگولHangulVBase4449
پایه صامت پایانی هانگولHangulTBase4519
شمار صامت آغازی هانگولHangulLCount19
شمار مصوت هانگولHangulVCount21
شمار صامت پایانی هانگولHangulTCount28
شمار هجای یک صامت هانگولHangulNCount588
شمار هجای هانگولHangulSCount11172
unicode-Hangul.salam
واردسازی یونیکد

روال ریشه:
    ل := ۱۸
    و۱ := ۰
    ت := ۴
    هجا := یونیکد.پایه هجای هانگول + (ل * یونیکد.شمار مصوت هانگول + و۱) * یونیکد.شمار صامت پایانی هانگول + ت
    سرچاپ هجا
    سرچاپ یونیکد.شمار هجای یک صامت هانگول، یونیکد.شمار هجای هانگول
    سرچاپ یونیکد.پایه صامت آغازی هانگول، یونیکد.پایه مصوت هانگول، یونیکد.پایه صامت پایانی هانگول
    سرچاپ یونیکد.شمار صامت آغازی هانگول
پایان
خروجی54620 588 11172 4352 4449 4519 19

نسخه Version

پایا نسخه: رشته = "16.0.0"
نسخه‌ی یونیکدی که داده‌های این بسته از آن ساخته شده‌اند.

نمونه‌ی این مورد همراه با موارد بالاتر آمده است: unicode-ZWNJ.salam

بیشترین طول تاشدن MaxFoldLen

پایا بیشترین طول تاشدن: صحیح۳۲ = 3
بیشترین تعداد کدنقطه‌ای که تاشدن کامل یک نویسه ممکن است بدهد. حافظه‌ای به این اندازه برای تاشدن هر نویسه‌ای کافی است.
unicode-ToUpper.salam
واردسازی یونیکد

روال ریشه:
    سرچاپ یونیکد.به بزرگ(۹۴۵)، یونیکد.به کوچک(۹۱۳)، یونیکد.به عنوانی(۴۵۴)، یونیکد.به تاشده(۹۱۳)
    سرچاپ یونیکد.به بزرگ(۱۵۸۸)
    ک := ۲۲۳
    سرچاپ یونیکد.تاشدن بلند دارد(ک)، یونیکد.طول تاشدن بلند(ک)
    تکرار یونیکد.طول تاشدن بلند(ک) در ای:
        چاپ یونیکد.تاشدن بلند در(ک، ای)، ""
    پایان
    سرچاپ ""
    سرچاپ یونیکد.بیشترین طول تاشدن
پایان
خروجی913 945 453 945 1588 true 2 115 115 3

دسته‌های کلی نویسه Cat…

هر نویسه در یونیکد یک «دسته‌ی کلی» دارد. دسته یکی از این عددها را برمی‌گرداند و نام دسته نام کوتاه دوحرفی‌اش را (مثل Lo). دسته‌هایی که حرف اولشان یکی است پشت‌سرهم شماره‌گذاری شده‌اند.
نامانگلیسیمقدار
دسته حرف بزرگCatLu0
دسته حرف کوچکCatLl1
دسته حرف عنوانیCatLt2
دسته حرف تغییردهندهCatLm3
دسته حرف دیگرCatLo4
دسته نشانه بی فاصلهCatMn5
دسته نشانه فاصله دارCatMc6
دسته نشانه دربرگیرندهCatMe7
دسته رقم دهدهیCatNd8
دسته عدد حرفیCatNl9
دسته عدد دیگرCatNo10
دسته نشانه اتصالCatPc11
دسته خط تیرهCatPd12
دسته نشانه بازCatPs13
دسته نشانه بستهCatPe14
دسته نقل قول آغازینCatPi15
دسته نقل قول پایانیCatPf16
دسته نشانه نگارشی دیگرCatPo17
دسته نماد ریاضیCatSm18
دسته نماد پولCatSc19
دسته نماد تغییردهندهCatSk20
دسته نماد دیگرCatSo21
دسته جداکننده فاصلهCatZs22
دسته جداکننده خطCatZl23
دسته جداکننده بندCatZp24
دسته کنترلیCatCc25
دسته قالبیCatCf26
دسته جانشینCatCs27
دسته کاربرد خصوصیCatCo28
دسته تعریف نشدهCatCn29
unicode-Category.salam
واردسازی یونیکد

روال ریشه:
    هر ک در [۶۵، ۱۵۸۸، ۱۷۷۶، ۱۶۱۴، ۸۲۰۴، ۱۲۲۸۸، ۸۸۸]:
        سرچاپ ک، یونیکد.نام دسته(ک)، یونیکد.دسته(ک)، یونیکد.تخصیص یافته است(ک)
    پایان
    سرچاپ یونیکد.دسته(۱۵۸۸) == یونیکد.دسته حرف دیگر
پایان
خروجی65 Lu 0 true 1588 Lo 4 true 1776 Nd 8 true 1614 Mn 5 true 8204 Cf 26 true 12288 Zs 22 true 888 Cn 29 false true

رده‌های شکست خوشه Gcb…

رده‌هایی که شکست خوشه برمی‌گرداند. بسته‌ی رشته با آن‌ها تشخیص می‌دهد کجای متن مرز یک «حرف دیده‌شده» است؛ مثلاً یک حرف و اعرابش، یا یک شکلک ترکیبی، یک خوشه‌اند.
نامانگلیسیمقدار
شکست خوشه دیگرGcbOther0
شکست خوشه سی آرGcbCR1
شکست خوشه ال افGcbLF2
شکست خوشه کنترلیGcbControl3
شکست خوشه گسترشGcbExtend4
شکست خوشه پیونددهنده بی عرضGcbZWJ5
شکست خوشه نشانگر منطقهGcbRegionalIndicator6
شکست خوشه پیشوندیGcbPrepend7
شکست خوشه نشانه فاصله دارGcbSpacingMark8
شکست خوشه هانگول الGcbL9
شکست خوشه هانگول ویGcbV10
شکست خوشه هانگول تیGcbT11
شکست خوشه هانگول ال ویGcbLV12
شکست خوشه هانگول ال وی تیGcbLVT13
شکست خوشه تصویرکGcbExtendedPictographic14
unicode-GraphemeBreak.salam
واردسازی یونیکد

روال ریشه:
    سرچاپ یونیکد.شکست خوشه(۱۶۱۴) == یونیکد.شکست خوشه گسترش
    سرچاپ یونیکد.شکست خوشه(۸۲۰۵) == یونیکد.شکست خوشه پیونددهنده بی عرض
    سرچاپ یونیکد.شکست خوشه(۱۲۸۵۱۲) == یونیکد.شکست خوشه تصویرک
    سرچاپ یونیکد.شکست خوشه(۱۰)، یونیکد.شکست خوشه(۶۵)
    سرچاپ یونیکد.شکست پیوند(۲۳۲۵) == یونیکد.شکست پیوند صامت، یونیکد.شکست پیوند(۲۳۸۱) == یونیکد.شکست پیوند پیونددهنده
پایان
خروجیtrue true true 2 0 true true

رده‌های شکست پیوند Incb…

رده‌هایی که شکست پیوند برمی‌گرداند. این قاعده صامت‌هایی را که در خط‌های هندی با نشانه‌ی ویرام به هم پیوسته‌اند در یک خوشه نگه می‌دارد.
نامانگلیسیمقدار
شکست پیوند هیچIncbNone0
شکست پیوند صامتIncbConsonant1
شکست پیوند گسترشIncbExtend2
شکست پیوند پیونددهندهIncbLinker3

نمونه‌ی این مورد همراه با موارد بالاتر آمده است: unicode-GraphemeBreak.salam

رده‌های دوسویه Bc…

رده‌ای که رده دوسویه برمی‌گرداند و الگوریتم متن دوسویه با آن تصمیم می‌گیرد هر نویسه در متن آمیخته‌ی فارسی و انگلیسی کجا نمایش داده شود. حرف‌های فارسی «عربی» هستند، حرف‌های انگلیسی «چپ به راست» و رقم‌ها رده‌ی خودشان را دارند.
نامانگلیسیمقدار
رده دوسویه چپ به راستBcL0
رده دوسویه راست به چپBcR1
رده دوسویه عربیBcAL2
رده دوسویه عدد اروپاییBcEN3
رده دوسویه جداکننده عدد اروپاییBcES4
رده دوسویه دنباله عدد اروپاییBcET5
رده دوسویه عدد عربیBcAN6
رده دوسویه جداکننده مشترک عددBcCS7
رده دوسویه نشانه بی فاصلهBcNSM8
رده دوسویه خنثای مرزیBcBN9
رده دوسویه جداکننده بندBcB10
رده دوسویه جداکننده قطعهBcS11
رده دوسویه فاصله سفیدBcWS12
رده دوسویه خنثای دیگرBcON13
رده دوسویه جاسازی چپ به راستBcLRE14
رده دوسویه جاسازی راست به چپBcRLE15
رده دوسویه بازنویسی چپ به راستBcLRO16
رده دوسویه بازنویسی راست به چپBcRLO17
رده دوسویه برداشتن قالبBcPDF18
رده دوسویه جداسازی چپ به راستBcLRI19
رده دوسویه جداسازی راست به چپBcRLI20
رده دوسویه جداسازی خودکارBcFSI21
رده دوسویه برداشتن جداسازیBcPDI22
unicode-BidiClass.salam
واردسازی یونیکد

روال ریشه:
    سرچاپ یونیکد.رده دوسویه(۶۵) == یونیکد.رده دوسویه چپ به راست
    سرچاپ یونیکد.رده دوسویه(۱۵۸۸) == یونیکد.رده دوسویه عربی
    سرچاپ یونیکد.رده دوسویه(۱۴۸۸) == یونیکد.رده دوسویه راست به چپ
    سرچاپ یونیکد.رده دوسویه(۱۷۷۶) == یونیکد.رده دوسویه عدد اروپایی، یونیکد.رده دوسویه(۱۶۳۲) == یونیکد.رده دوسویه عدد عربی
    سرچاپ یونیکد.گونه کروشه جفت(۴۰) == یونیکد.کروشه باز، یونیکد.گونه کروشه جفت(۴۱) == یونیکد.کروشه بسته
    سرچاپ یونیکد.کروشه جفت(۴۰)، یونیکد.کروشه جفت(۶۵)
پایان
خروجیtrue true true true true true true 41 65

گونه‌های کروشه Pbt…

نتیجه‌ی گونه کروشه جفت: آیا نویسه کروشه‌ی باز است، بسته، یا اصلاً کروشه نیست.
نامانگلیسیمقدار
کروشه هیچPbtNone0
کروشه بازPbtOpen1
کروشه بستهPbtClose2

نمونه‌ی این مورد همراه با موارد بالاتر آمده است: unicode-BidiClass.salam

شناسه‌ی خط‌ها Script…

هر خطی که یونیکد می‌شناسد یک شناسه دارد و خط یکی از این‌ها را برمی‌گرداند. حرف‌های فارسی و عربی هر دو «خط عربی» هستند. نویسه‌های «مشترک» مثل رقم‌ها و نشانه‌ها در چند خط به کار می‌روند و «موروثی» یعنی نویسه خط نویسه‌ی پیش از خودش را می‌گیرد، مثل اعراب.
نامانگلیسیمقدار
خط ناشناختهScriptUnknown0
خط مشترکScriptCommon1
خط لاتینScriptLatin2
خط یونانیScriptGreek3
خط سیریلیکScriptCyrillic4
خط ارمنیScriptArmenian5
خط عبریScriptHebrew6
خط عربیScriptArabic7
خط سریانیScriptSyriac8
خط تاناScriptThaana9
خط دواناگریScriptDevanagari10
خط بنگالیScriptBengali11
خط گورموکیScriptGurmukhi12
خط گجراتیScriptGujarati13
خط اوریاScriptOriya14
خط تامیلScriptTamil15
خط تلوگوScriptTelugu16
خط کاناداScriptKannada17
خط مالایالمScriptMalayalam18
خط سینهالاScriptSinhala19
خط تایلندیScriptThai20
خط لائوسیScriptLao21
خط تبتیScriptTibetan22
خط میانماریScriptMyanmar23
خط گرجیScriptGeorgian24
خط هانگولScriptHangul25
خط حبشیScriptEthiopic26
خط چروکیScriptCherokee27
خط بومیان کاناداScriptCanadianAboriginal28
خط اوغامScriptOgham29
خط رونیScriptRunic30
خط خمریScriptKhmer31
خط مغولیScriptMongolian32
خط هیراگاناScriptHiragana33
خط کاتاکاناScriptKatakana34
خط بوپوموفوScriptBopomofo35
خط هانScriptHan36
خط ییScriptYi37
خط ایتالیایی کهنScriptOldItalic38
خط گوتیکScriptGothic39
خط دزرتScriptDeseret40
خط موروثیScriptInherited41
خط تاگالوگScriptTagalog42
خط هانونوScriptHanunoo43
خط بوهیدScriptBuhid44
خط تاگبانواScriptTagbanwa45
خط لیمبوScriptLimbu46
خط تای لهScriptTaiLe47
خط خطی بScriptLinearB48
خط اوگاریتیScriptUgaritic49
خط شاویScriptShavian50
خط عثمانیاScriptOsmanya51
خط قبرسیScriptCypriot52
خط بریلScriptBraille53
خط بوگیسیScriptBuginese54
خط قبطیScriptCoptic55
خط تای لو نوScriptNewTaiLue56
خط گلاگولیتیکScriptGlagolitic57
خط تیفیناغScriptTifinagh58
خط سیلوتی ناگریScriptSylotiNagri59
خط فارسی باستانScriptOldPersian60
خط خروشتیScriptKharoshthi61
خط بالیاییScriptBalinese62
خط میخیScriptCuneiform63
خط فنیقیScriptPhoenician64
خط پاسپاScriptPhagsPa65
خط انکوScriptNko66
خط سونداییScriptSundanese67
خط لپچاScriptLepcha68
خط اول چیکیScriptOlChiki69
خط وایScriptVai70
خط سوراشتراScriptSaurashtra71
خط کایا لیScriptKayahLi72
خط رجنگScriptRejang73
خط لیکیاییScriptLycian74
خط کاریاییScriptCarian75
خط لیدیاییScriptLydian76
خط چامScriptCham77
خط تای تامScriptTaiTham78
خط تای ویتScriptTaiViet79
خط اوستاییScriptAvestan80
خط هیروگلیف مصریScriptEgyptianHieroglyphs81
خط سامریScriptSamaritan82
خط لیسوScriptLisu83
خط بامونScriptBamum84
خط جاوه‌ایScriptJavanese85
خط میتی مایکScriptMeeteiMayek86
خط آرامی شاهنشاهیScriptImperialAramaic87
خط عربی جنوبی کهنScriptOldSouthArabian88
خط پارتی کتیبه‌ایScriptInscriptionalParthian89
خط پهلوی کتیبه‌ایScriptInscriptionalPahlavi90
خط ترکی کهنScriptOldTurkic91
خط کیتیScriptKaithi92
خط باتاکScriptBatak93
خط براهمیScriptBrahmi94
خط منداییScriptMandaic95
خط چاکماScriptChakma96
خط مروئی شکستهScriptMeroiticCursive97
خط هیروگلیف مروئیScriptMeroiticHieroglyphs98
خط میائوScriptMiao99
خط شاراداScriptSharada100
خط سورا سومپنگScriptSoraSompeng101
خط تاکریScriptTakri102
خط آلبانی قفقازScriptCaucasianAlbanian103
خط باسا واScriptBassaVah104
خط دوپلویهScriptDuployan105
خط الباسانScriptElbasan106
خط گرانتاScriptGrantha107
خط پاهاو همونگScriptPahawhHmong108
خط خوجکیScriptKhojki109
خط خطی الفScriptLinearA110
خط مهاجنیScriptMahajani111
خط مانویScriptManichaean112
خط منده کیکاکوییScriptMendeKikakui113
خط مودیScriptModi114
خط مروScriptMro115
خط عربی شمالی کهنScriptOldNorthArabian116
خط نبطیScriptNabataean117
خط پالمیریScriptPalmyrene118
خط پائو چین هائوScriptPauCinHau119
خط پرمی کهنScriptOldPermic120
خط پهلوی زبوریScriptPsalterPahlavi121
خط سیدهامScriptSiddham122
خط خداوادیScriptKhudawadi123
خط تیرهوتاScriptTirhuta124
خط وارنگ چیتیScriptWarangCiti125
خط آهومScriptAhom126
خط هیروگلیف آناتولیScriptAnatolianHieroglyphs127
خط حضریScriptHatran128
خط مولتانیScriptMultani129
خط مجاری کهنScriptOldHungarian130
خط نشانه‌نویسیScriptSignWriting131
خط ادلمScriptAdlam132
خط بهایکسوکیScriptBhaiksuki133
خط مارچنScriptMarchen134
خط نواScriptNewa135
خط اوسیجScriptOsage136
خط تانگوتScriptTangut137
خط ماسارام گوندیScriptMasaramGondi138
خط نوشوScriptNushu139
خط سویومبوScriptSoyombo140
خط مربعی زنابازارScriptZanabazarSquare141
خط دوگراScriptDogra142
خط گونجالا گوندیScriptGunjalaGondi143
خط ماکاسارScriptMakasar144
خط مدفایدرینScriptMedefaidrin145
خط حنیفی روهینگیاScriptHanifiRohingya146
خط سغدیScriptSogdian147
خط سغدی کهنScriptOldSogdian148
خط عیلامیScriptElymaic149
خط ناندیناگریScriptNandinagari150
خط نیاکنگ پواچو همونگScriptNyiakengPuachueHmong151
خط وانچوScriptWancho152
خط خوارزمیScriptChorasmian153
خط دیوس آکوروScriptDivesAkuru154
خط ختایی کوچکScriptKhitanSmallScript155
خط ایزدیScriptYezidi156
خط قبرسی مینوسیScriptCyproMinoan157
خط اویغوری کهنScriptOldUyghur158
خط تانگساScriptTangsa159
خط توتوScriptToto160
خط ویتکوچیScriptVithkuqi161
خط کاویScriptKawi162
خط ناگ موندریScriptNagMundari163
خط گارایScriptGaray164
خط گورونگ خماScriptGurungKhema165
خط کیرات رایScriptKiratRai166
خط اول اونالScriptOlOnal167
خط سونوارScriptSunuwar168
خط تودریScriptTodhri169
خط تولو تیگالاریScriptTuluTigalari170
unicode-Script.salam
واردسازی یونیکد

روال ریشه:
    هر ک در [۶۵، ۱۵۸۸، ۹۴۵، ۲۰۰۱۳، ۱۲۳۵۴، ۱۷۷۶، ۱۶۱۴]:
        سرچاپ ک، یونیکد.نام خط(ک)
    پایان
    سرچاپ یونیکد.خط(۱۵۸۸) == یونیکد.خط عربی، یونیکد.خط(۶۵) == یونیکد.خط لاتین
    سرچاپ یونیکد.خط(۶۶۴۶۴) == یونیکد.خط فارسی باستان، یونیکد.نام خط(۶۶۴۶۴)
پایان
خروجی65 Latin 1588 Arabic 945 Greek 20013 Han 12354 Hiragana 1776 Arabic 1614 Inherited true true true Old_Persian

روال‌ها

دسته Category

روال دسته(cp: صحیح): صحیح
شماره‌ی دسته‌ی کلی نویسه را برمی‌گرداند؛ یکی از ثابت‌های «دسته» در بالا.

نمونه‌ی این مورد همراه با موارد بالاتر آمده است: unicode-Category.salam

نام دسته CategoryName

روال نام دسته(cp: صحیح): رشته
نام دوحرفی دسته را برمی‌گرداند، مثل Lo برای حرف فارسی و Nd برای رقم.

نمونه‌ی این مورد همراه با موارد بالاتر آمده است: unicode-Category.salam

تخصیص یافته است IsAssigned

روال تخصیص یافته است(cp: صحیح): منطقی
اگر این کدنقطه در یونیکد به نویسه‌ای داده شده باشد، درست برمی‌گرداند.

نمونه‌ی این مورد همراه با موارد بالاتر آمده است: unicode-Category.salam

حرف است IsLetter

روال حرف است(cp: صحیح): منطقی
اگر نویسه حرف باشد (دسته‌های L)، درست برمی‌گرداند.
unicode-IsLetter.salam
واردسازی یونیکد

روال ریشه:
    سرچاپ یونیکد.حرف است(۱۵۸۸)، یونیکد.الفبایی است(۱۶۱۴)، یونیکد.حرف است(۱۶۱۴)
    سرچاپ یونیکد.بزرگ است(۹۱۵)، یونیکد.کوچک است(۹۴۷)، یونیکد.عنوانی است(۴۵۳)
    سرچاپ یونیکد.نشانه است(۱۶۱۴)، یونیکد.رقم است(۱۷۷۶)، یونیکد.عدد است(۸۵۴۴)، یونیکد.رقم است(۸۵۴۴)
    سرچاپ یونیکد.الفبایی عددی است(۱۷۷۶)، یونیکد.نشانه نگارشی است(۱۵۴۸)، یونیکد.نماد است(۶۵۰۲۰)
    سرچاپ یونیکد.فاصله است(۱۲۲۸۸)، یونیکد.کنترلی است(۱۰)، یونیکد.قالبی است(۸۲۰۴)، یونیکد.کنترل اتصال است(۸۲۰۴)
پایان
خروجیtrue true false true true true true true true false true true true true true true true

الفبایی است IsAlphabetic

روال الفبایی است(cp: صحیح): منطقی
مثل حرف است، ولی گسترده‌تر: اعرابی که بخشی از خواندن حرف‌اند را هم حرف حساب می‌کند. بیشتر وقت‌ها منظور از «حرف است؟» همین است.

نمونه‌ی این مورد همراه با موارد بالاتر آمده است: unicode-IsLetter.salam

بزرگ است IsUpper

روال بزرگ است(cp: صحیح): منطقی
اگر نویسه حرف بزرگ باشد، درست برمی‌گرداند.

نمونه‌ی این مورد همراه با موارد بالاتر آمده است: unicode-IsLetter.salam

کوچک است IsLower

روال کوچک است(cp: صحیح): منطقی
اگر نویسه حرف کوچک باشد، درست برمی‌گرداند.

نمونه‌ی این مورد همراه با موارد بالاتر آمده است: unicode-IsLetter.salam

عنوانی است IsTitle

روال عنوانی است(cp: صحیح): منطقی
حرف‌های «عنوانی» معدودی که نیمی بزرگ و نیمی کوچک‌اند، مثل «Dž».

نمونه‌ی این مورد همراه با موارد بالاتر آمده است: unicode-IsLetter.salam

نشانه است IsMark

روال نشانه است(cp: صحیح): منطقی
اگر نویسه نشانه‌ی ترکیبی باشد، مثل فتحه و تشدید، درست برمی‌گرداند.

نمونه‌ی این مورد همراه با موارد بالاتر آمده است: unicode-IsLetter.salam

رقم است IsDigit

روال رقم است(cp: صحیح): منطقی
فقط رقم‌های دهدهی، از هر خطی؛ رقم فارسی هم حساب می‌شود.

نمونه‌ی این مورد همراه با موارد بالاتر آمده است: unicode-IsLetter.salam

عدد است IsNumber

روال عدد است(cp: صحیح): منطقی
هر نویسه‌ی عددی، از جمله عددهای رومی و کسرها؛ گسترده‌تر از رقم است.

نمونه‌ی این مورد همراه با موارد بالاتر آمده است: unicode-IsLetter.salam

الفبایی عددی است IsAlnum

روال الفبایی عددی است(cp: صحیح): منطقی
حرف یا رقم.

نمونه‌ی این مورد همراه با موارد بالاتر آمده است: unicode-IsLetter.salam

نشانه نگارشی است IsPunct

روال نشانه نگارشی است(cp: صحیح): منطقی
نشانه‌های نگارشی، مثل ویرگول فارسی.

نمونه‌ی این مورد همراه با موارد بالاتر آمده است: unicode-IsLetter.salam

نماد است IsSymbol

روال نماد است(cp: صحیح): منطقی
نمادها، مثل نماد ریال و علامت‌های ریاضی.

نمونه‌ی این مورد همراه با موارد بالاتر آمده است: unicode-IsLetter.salam

فاصله است IsSpace

روال فاصله است(cp: صحیح): منطقی
نویسه‌های فاصله بر اساس ویژگی رسمی White_Space یونیکد. نیم‌فاصله فاصله نیست.

نمونه‌ی این مورد همراه با موارد بالاتر آمده است: unicode-IsLetter.salam

کنترلی است IsControl

روال کنترلی است(cp: صحیح): منطقی
نویسه‌های کنترلی.

نمونه‌ی این مورد همراه با موارد بالاتر آمده است: unicode-IsLetter.salam

قالبی است IsFormat

روال قالبی است(cp: صحیح): منطقی
نویسه‌های قالبی نامرئی، مثل نیم‌فاصله و نشانه‌های جهت.

نمونه‌ی این مورد همراه با موارد بالاتر آمده است: unicode-IsLetter.salam

کنترل اتصال است IsJoinControl

روال کنترل اتصال است(cp: صحیح): منطقی
فقط نیم‌فاصله و پیونددهنده‌ی بی‌عرض؛ دو نویسه‌ای که چسبیدن حرف‌ها را کنترل می‌کنند.

نمونه‌ی این مورد همراه با موارد بالاتر آمده است: unicode-IsLetter.salam

به بزرگ ToUpper

روال به بزرگ(cp: صحیح): صحیح
شکل بزرگ یک نویسه را برمی‌گرداند؛ اگر نداشته باشد، خود نویسه را.

نمونه‌ی این مورد همراه با موارد بالاتر آمده است: unicode-ToUpper.salam

به کوچک ToLower

روال به کوچک(cp: صحیح): صحیح
شکل کوچک یک نویسه را برمی‌گرداند.

نمونه‌ی این مورد همراه با موارد بالاتر آمده است: unicode-ToUpper.salam

به عنوانی ToTitle

روال به عنوانی(cp: صحیح): صحیح
شکل عنوانی نویسه را برمی‌گرداند.

نمونه‌ی این مورد همراه با موارد بالاتر آمده است: unicode-ToUpper.salam

به تاشده ToFold

روال به تاشده(cp: صحیح): صحیح
شکل «تاشده»ی ساده‌ی نویسه را برمی‌گرداند؛ شکلی که برای مقایسه‌ی بدون حساسیت به بزرگی و کوچکی به کار می‌رود.

نمونه‌ی این مورد همراه با موارد بالاتر آمده است: unicode-ToUpper.salam

تاشدن بلند دارد HasFullFold

روال تاشدن بلند دارد(cp: صحیح): منطقی
اگر تاشدن کامل نویسه بیش از یک کدنقطه باشد، درست برمی‌گرداند؛ مثل «ß» که به «ss» تا می‌شود.

نمونه‌ی این مورد همراه با موارد بالاتر آمده است: unicode-ToUpper.salam

طول تاشدن بلند FullFoldLen

روال طول تاشدن بلند(cp: صحیح): صحیح
تعداد کدنقطه‌های تاشدن کامل نویسه.

نمونه‌ی این مورد همراه با موارد بالاتر آمده است: unicode-ToUpper.salam

تاشدن بلند در FullFoldAt

روال تاشدن بلند در(cp: صحیح، k: صحیح): صحیح
کدنقطه‌ی شماره‌ی k از تاشدن کامل نویسه.

نمونه‌ی این مورد همراه با موارد بالاتر آمده است: unicode-ToUpper.salam

رده ترکیبی CombiningClass

روال رده ترکیبی(cp: صحیح): صحیح
رده‌ی ترکیبی نشانه را برمی‌گرداند. هنگام یکسان‌سازی، اعرابی که دنبال یک حرف می‌آیند بر اساس این عدد مرتب می‌شوند تا ترتیب تایپشان مهم نباشد. برای نویسه‌های معمولی صفر است.
unicode-Decomp.salam
واردسازی یونیکد

روال ریشه:
    آ := ۱۵۷۰
    سرچاپ یونیکد.طول تجزیه(آ)، یونیکد.تجزیه در(آ، ۰)، یونیکد.تجزیه در(آ، ۱)
    سرچاپ یونیکد.ترکیب(۱۵۷۵، ۱۶۱۹)، یونیکد.ترکیب(۱۵۷۵، ۶۵)
    سرچاپ یونیکد.رده ترکیبی(۱۶۱۴)، یونیکد.رده ترکیبی(۱۶۱۶)، یونیکد.رده ترکیبی(۱۵۷۵)
    لا := ۶۵۲۷۱
    سرچاپ یونیکد.طول تجزیه(لا)، یونیکد.طول تجزیه سازگاری(لا)
    سرچاپ یونیکد.تجزیه سازگاری در(لا، ۰)، یونیکد.تجزیه سازگاری در(لا، ۱)
پایان
خروجی2 1575 1619 1570 -1 30 32 0 1 3 1604 1575

طول تجزیه DecompLen

روال طول تجزیه(cp: صحیح): صحیح
تعداد کدنقطه‌های تجزیه‌ی متعارف نویسه؛ اگر تجزیه نشود صفر.

نمونه‌ی این مورد همراه با موارد بالاتر آمده است: unicode-Decomp.salam

تجزیه در DecompAt

روال تجزیه در(cp: صحیح، k: صحیح): صحیح
کدنقطه‌ی شماره‌ی k از تجزیه‌ی متعارف نویسه.

نمونه‌ی این مورد همراه با موارد بالاتر آمده است: unicode-Decomp.salam

طول تجزیه سازگاری CompatDecompLen

روال طول تجزیه سازگاری(cp: صحیح): صحیح
تعداد کدنقطه‌های تجزیه‌ی سازگاری نویسه. شکل‌های نمایشی عربی اینجا به حرف‌های معمولی باز می‌شوند.

نمونه‌ی این مورد همراه با موارد بالاتر آمده است: unicode-Decomp.salam

تجزیه سازگاری در CompatDecompAt

روال تجزیه سازگاری در(cp: صحیح، k: صحیح): صحیح
کدنقطه‌ی شماره‌ی k از تجزیه‌ی سازگاری.

نمونه‌ی این مورد همراه با موارد بالاتر آمده است: unicode-Decomp.salam

ترکیب Compose

روال ترکیب(a: صحیح، b: صحیح): صحیح
دو کدنقطه را، اگر ترکیب متعارفی داشته باشند، به یک کدنقطه تبدیل می‌کند؛ وگرنه منفی یک برمی‌گرداند. «ا» و مدّ با هم «آ» می‌شوند.

نمونه‌ی این مورد همراه با موارد بالاتر آمده است: unicode-Decomp.salam

شکست خوشه GraphemeBreak

روال شکست خوشه(cp: صحیح): صحیح
رده‌ی شکست خوشه‌ی نویسه را برمی‌گرداند.

نمونه‌ی این مورد همراه با موارد بالاتر آمده است: unicode-GraphemeBreak.salam

شکست پیوند ConjunctBreak

روال شکست پیوند(cp: صحیح): صحیح
رده‌ی شکست پیوند نویسه را برمی‌گرداند؛ برای خط‌های هندی.

نمونه‌ی این مورد همراه با موارد بالاتر آمده است: unicode-GraphemeBreak.salam

رده دوسویه BidiClass

روال رده دوسویه(cp: صحیح): صحیح
رده‌ی دوسویه‌ی نویسه را برمی‌گرداند.

نمونه‌ی این مورد همراه با موارد بالاتر آمده است: unicode-BidiClass.salam

گونه کروشه جفت PairedBracketType

روال گونه کروشه جفت(cp: صحیح): صحیح
می‌گوید نویسه کروشه‌ی باز است، بسته، یا هیچ‌کدام.

نمونه‌ی این مورد همراه با موارد بالاتر آمده است: unicode-BidiClass.salam

کروشه جفت PairedBracket

روال کروشه جفت(cp: صحیح): صحیح
جفت یک کروشه را برمی‌گرداند؛ جفت «(» می‌شود «)». برای نویسه‌ای که کروشه نیست، خود نویسه را برمی‌گرداند.

نمونه‌ی این مورد همراه با موارد بالاتر آمده است: unicode-BidiClass.salam

خط Script

روال خط(cp: صحیح): صحیح
شناسه‌ی خط نویسه را برمی‌گرداند.

نمونه‌ی این مورد همراه با موارد بالاتر آمده است: unicode-Script.salam

نام خط ScriptName

روال نام خط(cp: صحیح): رشته
نام انگلیسی خط نویسه را برمی‌گرداند، مثل Arabic.

نمونه‌ی این مورد همراه با موارد بالاتر آمده است: unicode-Script.salam