معالجة اللغة الطبيعية والنماذج اللغوية الكبيرة
من التقطيع إلى المحوّلات إلى نماذج تتحدّث
OVERVIEW
- جميع المداخل
- 6
- مبتدئ
- 2
- متوسط
- 3
- متقدم
- 1
Language is cut into tokens, compressed into vectors, and then made to “look at” itself through attention — a loop so plain it seems excessive, yet it lifted next-token prediction all the way to a general assistant. This domain traces that path in order: bag of words, embeddings, RNNs, attention, Transformers, pre-training and alignment.
الأسئلة التي يجيب عنها هذا المجال
- Q1
What exactly does a model see when it reads a word?
- Q2
Why does attention beat recurrence?
- Q3
Why does next-token prediction yield conversation?
مداخل هذا المجال
- 01الترميز إلى رموز (Tokenization)مبتدئلا تقرأ النماذج الحروف بل الرموز، وطريقة التقسيم تحدّد القدرة والكلفة بصمت
- 02التضمينات اللفظيةمبتدئتحويل الكلمات إلى إحداثيات: تتجمّع المترادفات تلقائياً ويصبح المعنى قابلاً للجمع والطرح
- 03آلية الانتباهمتوسطيستطيع كل موضع أن ينظر مباشرة إلى جميع المواضع الأخرى ويوزّع الانتباه حسب الصلة
- 04معمارية Transformerمتوسطيستبدل النقل كلمةً بكلمة بغرفة يتحدث فيها الجميع معاً، فتصبح التبعيات البعيدة على مسافة خطوة واحدة
- 05التدريب المسبق والضبط الدقيقمتوسطتعلّم اللغة أولاً من نصوص ضخمة بلا وسوم ثم التخصص ببيانات قليلة — أكثر النماذج كفاءةً في البيانات
- 06هندسة الأوامر والمواءمةمتقدمجعل النموذج مفيداً وصادقاً وغير ضارّ أصعب من مجرد تكبيره