
پردازش زبان طبیعی یا Natural Language Processing (NLP) یکی از مهمترین شاخههای هوش مصنوعی است که هدف آن ایجاد توانایی برای رایانهها در پردازش، تحلیل و تولید زبان انسان است. زبان انسان برخلاف دادههای عددی ساختاریافته، پیچیده، وابسته به زمینه و دارای روابط معنایی و دستوری متنوعی است. به همین دلیل، یکی از چالشهای اصلی در پردازش زبان طبیعی این است که چگونه میتوان متن را به شکلی ساختاریافته نمایش داد تا الگوریتمهای یادگیری ماشین و مدلهای هوش مصنوعی بتوانند الگوهای موجود در آن را شناسایی کنند. یکی از روشهای کلاسیک و بسیار مهم برای تحلیل ساختار متن، N-gram است. N-gram به دنبالهای از N کلمه یا واحد متنی گفته میشود که بهصورت متوالی از یک متن استخراج میشوند. برای مثال، اگر مقدار N برابر با 1 باشد، با Unigram، اگر برابر با 2 باشد، با Bigram و اگر برابر با 3 باشد، با Trigram مواجه هستیم. اگرچه مدلهای مدرن مبتنی بر Transformer و مدلهای زبانی بزرگ مانند GPT تواناییهای بسیار پیشرفتهتری دارند، مفهوم N-gram همچنان یکی از مفاهیم پایه و ارزشمند در یادگیری NLP است و در تحلیل متن، مدلسازی زبان، پیشبینی کلمات، تشخیص اسپم و بسیاری از کاربردهای دیگر مورد استفاده قرار میگیرد. در ادامه با آرتیجنس همراه باشید.
N-gram چیست؟
N-gram یک توالی متوالی از N واحد در یک متن است. این واحدها معمولاً کلمه هستند، اما بسته به نوع سیستم میتوانند شامل کاراکترها یا توکنها نیز باشند. حرف N در N-gram نشاندهنده تعداد واحدهایی است که در هر بخش از متن در کنار یکدیگر قرار میگیرند. بنابراین، Unigram از یک واحد، Bigram از دو واحد، Trigram از سه واحد و به همین ترتیب N-gramهای بزرگتر از تعداد بیشتری واحد تشکیل میشوند.
برای درک سادهتر، جمله زیر را در نظر بگیرید:
هوش مصنوعی آینده فناوری است.
اگر بخواهیم از این جمله Unigram استخراج کنیم، هر کلمه بهصورت مستقل در نظر گرفته میشود:
هوش | مصنوعی | آینده | فناوری | است
در حالت Bigram، کلمات بهصورت جفتهای متوالی بررسی میشوند:
هوش مصنوعی | مصنوعی آینده | آینده فناوری | فناوری است
و در حالت Trigram، هر سه کلمه متوالی یک گروه تشکیل میدهند:
هوش مصنوعی آینده | مصنوعی آینده فناوری | آینده فناوری است
بنابراین، N-gram به الگوریتم کمک میکند بهجای بررسی کلمات بهصورت کاملاً مستقل، ارتباط میان واحدهای متوالی متن را نیز بررسی کند. همین ویژگی باعث شده است N-gram یکی از روشهای مهم در تاریخ توسعه سیستمهای پردازش زبان طبیعی باشد.
انواع N-gram در پردازش زبان طبیعی
انواع N-gram بر اساس مقدار N نامگذاری میشوند و هرچه مقدار N افزایش پیدا کند، مدل میتواند روابط طولانیتری میان کلمات را در نظر بگیرد. البته افزایش N در کنار مزایا، هزینه محاسباتی و مشکلات دادهای بیشتری نیز ایجاد میکند. در جدول زیر مهمترین انواع N-gram را مشاهده میکنید:
| نوع N-gram | مقدار N | مثال | کاربرد رایج |
|---|---|---|---|
| Unigram | 1 | هوش | تحلیل فراوانی کلمات |
| Bigram | 2 | هوش مصنوعی | بررسی ارتباط دو کلمه |
| Trigram | 3 | هوش مصنوعی آینده | تحلیل عبارات کوتاه |
| 4-gram | 4 | هوش مصنوعی آینده فناوری | تحلیل الگوهای طولانیتر |
| 5-gram | 5 | هوش مصنوعی آینده فناوری است | مدلسازی متن با زمینه بیشتر |
Unigram چیست؟
Unigram سادهترین نوع N-gram است که در آن هر کلمه بهصورت مستقل از کلمات دیگر بررسی میشود. برای مثال، جمله «هوش مصنوعی آینده فناوری است» در مدل Unigram به پنج واحد تقسیم میشود. این روش در بسیاری از تکنیکهای کلاسیک پردازش متن، از جمله Bag of Words و برخی روشهای تحلیل فراوانی کلمات، کاربرد دارد. مزیت اصلی Unigram سادگی، سرعت بالا و نیاز کمتر به داده است، اما یک محدودیت مهم دارد: ترتیب کلمات و ارتباط میان آنها را در نظر نمیگیرد. برای مثال، عبارات «علم داده» و «داده علم» از نظر مجموعه کلمات ممکن است مشابه باشند، در حالی که از نظر معنایی و ساختاری یکسان نیستند.
Bigram چیست؟
Bigram شامل دو واحد متوالی است و برخلاف Unigram میتواند بخشی از ارتباط میان کلمات را نشان دهد. برای مثال، در جمله «پردازش زبان طبیعی» میتوان دو Bigram شامل «پردازش زبان» و «زبان طبیعی» استخراج کرد. Bigram در تحلیل عبارات رایج، پیشبینی کلمه بعدی و مدلسازی زبان کاربرد زیادی دارد. این روش معمولاً تعادل مناسبی میان سادگی و توانایی شناسایی روابط متنی ایجاد میکند و در بسیاری از پروژههای کلاسیک NLP گزینهای کاربردی محسوب میشود.
Trigram چیست؟
در Trigram سه واحد متوالی در کنار یکدیگر قرار میگیرند. برای مثال، عبارت «پردازش زبان طبیعی» یک Trigram کامل است. Trigram نسبت به Bigram اطلاعات بیشتری درباره زمینه کلمات در اختیار مدل قرار میدهد و میتواند عبارات مشخصتری را شناسایی کند. با این حال، هرچه N افزایش پیدا کند، تعداد ترکیبهای احتمالی نیز بیشتر میشود و برای پوشش مناسب این ترکیبها به دادههای آموزشی بیشتری نیاز خواهیم داشت.
N-gram چگونه در NLP کار میکند؟
برای استفاده از N-gramابتدا باید متن خام پردازش شود. این مرحله معمولاً شامل پاکسازی متن، حذف یا اصلاح نویزهای موجود، توکنسازی و در برخی پروژهها حذف کلمات توقف یا انجام Lemmatization و Stemming است. پس از آمادهسازی متن، الگوریتم با حرکت روی توالی کلمات، گروههایی با اندازه مشخص تولید میکند.
فرض کنید متن زیر را داریم:
من به یادگیری هوش مصنوعی علاقه دارم.
در حالت Bigram، توالیهای زیر استخراج میشوند:
من به
به یادگیری
یادگیری هوش
هوش مصنوعی
مصنوعی علاقه
علاقه دارم
اگر N را برابر با 3 قرار دهیم، Trigramها به شکل زیر خواهند بود:
من به یادگیری
به یادگیری هوش
یادگیری هوش مصنوعی
هوش مصنوعی علاقه
مصنوعی علاقه دارم
پس از استخراج N-gramها، میتوان تعداد تکرار هر یک را محاسبه کرد. این اطلاعات میتواند برای شناسایی عبارات پرتکرار، پیشبینی کلمات، تحلیل متن و ساخت مدلهای زبانی استفاده شود.

کاربردهای N-gram در پردازش زبان طبیعی
N-gram با وجود سادگی، در بسیاری از مسائل پردازش زبان طبیعی کاربرد دارد. این روش بهخصوص در سیستمهای کلاسیک NLP که پیش از ظهور مدلهای عمیق و Transformer توسعه داده شدهاند، نقش مهمی داشته است. حتی امروز نیز N-gram میتواند بهعنوان یک روش پایه برای تحلیل دادههای متنی، ساخت ویژگیهای ورودی مدلهای یادگیری ماشین و ایجاد Baseline برای مقایسه مدلهای پیچیدهتر مورد استفاده قرار گیرد.
۱. مدلسازی زبان
یکی از مهمترین کاربردهای N-gram، Language Modeling یا مدلسازی زبان است. هدف مدل زبانی این است که احتمال رخ دادن یک کلمه یا توالی کلمات را بر اساس کلمات قبلی تخمین بزند. برای مثال، اگر جملهای با عبارت «من امروز به» آغاز شود، یک مدل زبانی میتواند احتمال کلمات مختلف مانند «دانشگاه»، «مدرسه» یا «بازار» را تخمین بزند. در یک مدل Bigram، احتمال یک کلمه بر اساس کلمه قبلی بررسی میشود؛ در حالی که در یک مدل Trigram، دو کلمه قبلی نیز در نظر گرفته میشوند. بنابراین مدلهای N-gram میتوانند به شکل آماری یاد بگیرند که چه کلماتی معمولاً در کنار یکدیگر ظاهر میشوند.
۲. پیشبینی کلمه بعدی
N-gram میتواند برای پیشبینی کلمه بعدی در یک جمله استفاده شود. برای مثال، اگر سیستم عبارت «من به هوش» را دریافت کند، بر اساس دادههای آموزشی میتواند بررسی کند که چه کلماتی معمولاً پس از این توالی ظاهر میشوند. اگر در دادههای آموزشی عبارت «هوش مصنوعی» بسیار تکرار شده باشد، احتمال انتخاب «مصنوعی» افزایش پیدا میکند. البته این روش با سیستمهای پیشرفته امروزی مانند LLMها تفاوت زیادی دارد. مدلهای N-gram معمولاً فقط یک پنجره محدود از کلمات قبلی را بررسی میکنند، در حالی که مدلهای مدرن Transformer میتوانند وابستگیهای بسیار پیچیدهتری را در متن تحلیل کنند.
۳. تشخیص اسپم
یکی دیگر از کاربردهای N-gram، Spam Detection یا تشخیص پیامهای ناخواسته است. در این روش میتوان N-gramهای موجود در پیامهای اسپم و پیامهای عادی را استخراج و سپس از آنها بهعنوان ویژگی در یک مدل یادگیری ماشین استفاده کرد. برای مثال، عبارتهایی مانند «برنده جایزه شوید»، «فرصت محدود» یا سایر الگوهای پرتکرار ممکن است در پیامهای اسپم بیشتر دیده شوند. سیستم با بررسی فراوانی این الگوها میتواند احتمال اسپم بودن یک پیام را تخمین بزند. استفاده از Bigram و Trigram در چنین سیستمهایی میتواند بهتر از بررسی کلمات منفرد باشد؛ زیرا ترکیب چند کلمه معمولاً اطلاعات بیشتری درباره نوع و محتوای پیام ارائه میدهد.
۴. تحلیل احساسات
در Sentiment Analysis یا تحلیل احساسات، هدف شناسایی نگرش یا احساس موجود در یک متن است. برای مثال، یک سیستم ممکن است نظرات کاربران درباره یک محصول را به دستههای مثبت، منفی یا خنثی تقسیم کند. N-gram میتواند بهعنوان ویژگی ورودی مدل استفاده شود. برای مثال، عبارت «اصلاً خوب نیست» اطلاعات مهمی درباره احساس منفی متن دارد. اگر سیستم فقط تککلمات را بررسی کند، ممکن است معنای واقعی جمله را بهدرستی تشخیص ندهد؛ اما استفاده از Bigram یا Trigram میتواند بخشی از این روابط را حفظ کند.
۵. استخراج عبارتهای کلیدی
N-gram میتواند برای پیدا کردن عبارتهای پرتکرار و مهم در مجموعهای از اسناد استفاده شود. برای مثال، در یک مجموعه مقاله درباره هوش مصنوعی، عبارتهایی مانند «یادگیری ماشین»، «پردازش زبان طبیعی» و «شبکه عصبی» ممکن است بهعنوان Bigram یا Trigramهای پرتکرار شناسایی شوند. این قابلیت در تحلیل محتوای وب، دستهبندی اسناد، استخراج کلمات کلیدی و حتی برخی فرایندهای تحقیق کلمات کلیدی در سئو نیز میتواند مفید باشد.
۶. تصحیح غلطهای املایی
یکی دیگر از کاربردهای جالب N-gram، کمک به سیستمهای Spell Checking است. اگر یک کلمه به اشتباه نوشته شده باشد، سیستم میتواند با بررسی کلمات اطراف آن و مقایسه با الگوهای رایج در یک پیکره متنی، گزینههای محتمل را پیشنهاد دهد. برای مثال، اگر یک عبارت از نظر آماری بسیار غیرطبیعی باشد، سیستم میتواند بررسی کند که آیا با تغییر یک کلمه به گزینهای دیگر، توالی حاصل احتمال بیشتری پیدا میکند یا خیر. البته سیستمهای مدرن تصحیح متن از روشهای بسیار پیشرفتهتری نیز استفاده میکنند.
۷. ترجمه ماشینی
در نسلهای قدیمیتر سیستمهای ترجمه ماشینی آماری، مدلهای N-gram نقش مهمی داشتند. این سیستمها میتوانستند با استفاده از دادههای ترجمهشده، احتمال رخداد توالیهای مختلف کلمات را تخمین بزنند و در کنار مدلهای ترجمه از آنها استفاده کنند. امروزه ترجمه ماشینی عصبی و مدلهای Transformer در بسیاری از کاربردها جایگزین روشهای آماری قدیمی شدهاند، اما مطالعه N-gram برای درک تاریخچه و تکامل ترجمه ماشینی اهمیت زیادی دارد.

رابطه N-gram با مدلهای زبانی
مدلهای N-gram را میتوان یکی از نخستین رویکردهای مهم برای ساخت مدلهای زبانی آماری دانست. ایده اصلی این مدلها ساده است: برای پیشبینی یک کلمه، به تعدادی از کلمات قبلی نگاه کنیم و بر اساس دادههای مشاهدهشده، احتمال کلمه بعدی را تخمین بزنیم. برای مثال، در یک مدل Bigram، رابطه میان دو کلمه بررسی میشود. در یک مدل Trigram، سه کلمه متوالی مورد توجه قرار میگیرند. این مدلها نسبت به روشهای ساده مبتنی بر فراوانی کلمات، توانایی بیشتری برای درک الگوهای زبانی دارند، اما همچنان محدودیت مهمی دارند و آن محدود بودن زمینه یا Context است. برای مثال، اگر یک مدل فقط سه کلمه قبلی را بررسی کند، اطلاعاتی که دهها کلمه قبلتر در متن وجود دارد ممکن است کاملاً نادیده گرفته شود. این مسئله یکی از دلایلی بود که پژوهشگران به سمت روشهای پیشرفتهتر مانند شبکههای عصبی بازگشتی، LSTM و در نهایت Transformer حرکت کردند.
مزایا و معایب N-gram
N-gram مانند هر روش دیگری دارای نقاط قوت و ضعف است. شناخت این مزایا و محدودیتها کمک میکند بدانیم چه زمانی استفاده از آن منطقی است و چه زمانی باید به سراغ روشهای پیشرفتهتر برویم.
مزایای N-gram
• سادگی در پیادهسازی و درک: مدلهای N-gram ساختار سادهای دارند و درک منطق عملکرد آنها برای افرادی که بهتازگی پردازش زبان طبیعی را یاد میگیرند آسان است.
• سرعت پردازش بالا: به دلیل ساختار نسبتاً ساده، استخراج و پردازش N-gramها معمولاً سریعتر از بسیاری از روشهای پیچیده یادگیری عمیق انجام میشود.
• نیاز کمتر به منابع محاسباتی: N-gramها برای اجرا به سختافزار قدرتمند و منابع محاسباتی زیادی نیاز ندارند و میتوان آنها را در پروژههای سبک نیز استفاده کرد.
• مناسب برای پروژههای کوچک: زمانی که حجم داده یا پیچیدگی مسئله زیاد نیست، N-gram میتواند روشی ساده و کاربردی برای تحلیل متن باشد.
معایب N-gram
• محدود بودن زمینه (Context): مدل N-gram فقط تعداد مشخصی از کلمات قبلی را در نظر میگیرد و ممکن است اطلاعات مهمی که در بخشهای دورتر متن قرار دارند نادیده گرفته شوند.
• عدم توانایی در درک وابستگیهای بلندمدت: اگر ارتباط معنایی بین دو کلمه به فاصله زیادی در متن وابسته باشد، N-gram معمولاً نمیتواند این رابطه را بهدرستی شناسایی کند.
• افزایش تعداد ترکیبها با بزرگتر شدن N: هرچه مقدار N افزایش پیدا کند، تعداد N-gramهای احتمالی بهشدت بیشتر میشود و مدیریت آنها دشوارتر خواهد شد.
• نیاز به دادههای بیشتر: برای اینکه N-gramهای بزرگتر بتوانند عملکرد مناسبی داشته باشند، باید حجم زیادی از دادههای متنی در اختیار مدل قرار گیرد.

تفاوت N-gram با مدلهای Transformer
با ظهور معماری Transformer، روش پردازش زبان طبیعی وارد مرحله جدیدی شد. مدلهای N-gram بر اساس پنجرهای محدود از کلمات کار میکنند، در حالی که Transformerها با استفاده از مکانیزم Attention میتوانند روابط میان بخشهای مختلف یک متن را بهتر مدل کنند. برای مثال، در یک مدل Trigram، هنگام پیشبینی یک کلمه، فقط دو کلمه قبلی در نظر گرفته میشوند؛ اما در مدلهای مبتنی بر Transformer، اطلاعات بسیار بیشتری از متن میتواند برای تحلیل رابطه میان کلمات مورد استفاده قرار گیرد. این تفاوت یکی از عوامل اصلی قدرت مدلهای مدرن زبانی است. با وجود این، N-gram هنوز ارزش آموزشی و عملی خود را از دست نداده است. درک N-gram باعث میشود مفاهیمی مانند مدلسازی زبان، پیشبینی کلمه، احتمال توالی و استخراج ویژگیهای متنی را بهتر درک کنیم. بسیاری از مفاهیم پیشرفته NLP را میتوان با شناخت درست همین اصول پایه راحتتر یاد گرفت.
آیا N-gram هنوز کاربرد دارد؟
با وجود توسعه مدلهای بزرگ زبانی و روشهای مبتنی بر Transformer، پاسخ این سؤال مثبت است. N-gram هنوز در پروژههای کوچک، تحلیل آماری متن، استخراج ویژگی، تشخیص الگوهای متنی و ساخت سیستمهای سبک میتواند مفید باشد. در شرایطی که منابع محاسباتی محدود هستند یا هدف پروژه صرفاً شناسایی عبارات پرتکرار و الگوهای سطحی متن است، استفاده از N-gram میتواند بسیار منطقی باشد.
همچنین N-gram برای آموزش مفاهیم پایه NLP اهمیت زیادی دارد. کسی که قصد دارد وارد حوزه هوش مصنوعی، یادگیری ماشین و پردازش زبان طبیعی شود، با یادگیری N-gram بهتر میتواند مفهوم مدل زبانی و محدودیتهای روشهای آماری را درک کند و سپس مسیر تکامل NLP از مدلهای ساده آماری به RNN، LSTM، Attention و Transformer را دنبال کند.
نتیجه گیری:
N-gram چیست؟ N-gram روشی برای تقسیم متن به توالیهای متوالی از N واحد است که معمولاً کلمات یا توکنها را شامل میشود. Unigram یک کلمه، Bigram دو کلمه و Trigram سه کلمه متوالی را در هر بخش در نظر میگیرد. این روش یکی از مفاهیم پایه و مهم در پردازش زبان طبیعی محسوب میشود و در طول سالها برای مدلسازی زبان، پیشبینی کلمات، تشخیص اسپم، تحلیل احساسات، استخراج عبارتهای کلیدی، تصحیح متن و ترجمه ماشینی مورد استفاده قرار گرفته است.
مهمترین نقطه قوت N-gram سادگی و سرعت آن است، اما محدود بودن زمینه، افزایش شدید تعداد ترکیبها با بزرگتر شدن N و مشکل N-gramهای دیدهنشده از محدودیتهای اصلی آن محسوب میشوند. مدلهای مدرن مبتنی بر Transformer توانستهاند بسیاری از این محدودیتها را برطرف کنند و به مدلهای هوش مصنوعی امکان دهند روابط پیچیدهتر و وابستگیهای طولانیتر موجود در زبان را تحلیل کنند.
منبع مقاله:

شاهین آقامعلی


پاسخ :