تصدير السيرة الذاتية العربية إلى PDF دون كسر النص
By Mustafa Tarabya, founder of CVBooster · Published · Updated
12 min read
كتبت سيرتك الذاتية بالعربية في وورد. ضبطت المحاذاة إلى اليمين، اخترت خطًا يعجبك، صدّرتها إلى PDF، وفتحت الملف مرة أخيرة قبل الإرسال. كل شيء سليم. ثم أرسلتها إلى عشرات الوظائف ولم يرد أحد.
المشكلة أن الملف الذي فتحته لم يكن الملف الذي وصل. أنت فتحته على الجهاز نفسه الذي كتبته عليه، بالخطوط نفسها المثبتة عنده، وغالبًا في نفس تطبيق وورد. الطرف الآخر فتحه في متصفح، أو في قارئ داخل منصة توظيف، أو لم يفتحه إنسان أصلًا بل مرّ على محلل نصوص آلي. وفي أي من هذه الحالات الثلاث، النص العربي قادر على الانهيار بطرق لا يعرفها من يكتب بالحروف اللاتينية: حروف تتفكك عن بعضها، جملة تظهر مقلوبة، تاريخ يقرأ من اليسار فيصبح المعنى عكس المقصود، أو ملف يبدو مثاليًا للعين ولا يحتوي على حرف واحد قابل للقراءة الآلية.
هذا المقال لا يتحدث عن محتوى السيرة الذاتية ولا عن صياغتها. يتحدث عن الطبقة التقنية تحتها: كيف يُخزَّن النص العربي داخل ملف PDF، ولماذا ينكسر، وكيف تتأكد خلال دقيقتين أن ملفك سليم قبل أن ترسله إلى أي جهة.
ثلاثة أعطال مختلفة يخلطها الجميع في شكوى واحدة
حين يقول أحدهم "العربي طلع مكسور في الـ PDF" فهو غالبًا يصف واحدًا من ثلاثة أعطال منفصلة تمامًا، ولكل منها سبب مختلف وعلاج مختلف. الخلط بينها هو السبب في أن الحلول المتداولة في المنتديات لا تنجح.
- عطل التشكيل الخطي (Shaping): الحروف تظهر منفصلة عن بعضها هكذا "م ر ح ب ا" بدل "مرحبا". السبب أن محرك العرض لم يطبّق قواعد الوصل، إما لغياب جداول OpenType في الخط أو لأن البرنامج لا يدعم التخطيط النصي المعقد.
- عطل الاتجاه (Bidi): الحروف موصولة بشكل صحيح لكن ترتيب الكلمات أو الأرقام معكوس. الجملة تبدأ من الطرف الخطأ، أو التاريخ "2020 - 2024" يظهر "2024 - 2020". السبب هنا خوارزمية الاتجاه الثنائي، لا الخط.
- عطل الاستخراج (Extraction): الملف يبدو مثاليًا على الشاشة، لكن حين تنسخ منه النص تحصل على رموز مقلوبة أو فارغة. هذا أخطر الثلاثة لأنه غير مرئي تمامًا لك، ومرئي بالكامل لأي نظام يقرأ الملف آليًا.
العطل الثالث هو الذي يقتل الترشيحات بصمت. الأول والثاني يراهما الموظف ويستنتج أن هناك خللًا تقنيًا وقد يتسامح. الثالث لا يراه أحد، ونتيجته أن نظام تتبع المتقدمين يسجل سيرتك على أنها ملف بلا محتوى، فلا تطابق أي كلمة مفتاحية في الوصف الوظيفي مهما كانت خبرتك.
لماذا العربية تحديدًا؟ الفرق بين ما تكتبه وما يُخزَّن
حين تكتب حرف الهاء في وورد فأنت تكتب رمزًا واحدًا في يونيكود هو U+0647، ضمن نطاق الحروف العربية الأساسي U+0600 إلى U+06FF. لكن هذا الحرف يُرسم بأربعة أشكال مختلفة حسب موقعه: منفصلًا، وأول الكلمة، ووسطها، وآخرها. الرمز واحد والشكل أربعة. الذي يختار الشكل الصحيح هو محرك التشكيل، عبر خصائص OpenType المخزنة داخل الخط نفسه، وأهمها isol و init و medi و fina، إضافة إلى rlig التي تنتج تراكيب مثل لام ألف.
خلاصة ذلك أن الحرف العربي يحتاج طرفين ليظهر صحيحًا: نص مخزَّن بالرموز الأساسية، وخط يحمل جداول التشكيل كاملة. إذا سقط أحدهما انهار الشكل. وهنا يظهر الفخ الأكبر: يونيكود يحتوي على نطاقين قديمين اسمهما نماذج العرض العربية، هما U+FB50 إلى U+FDFF و U+FE70 إلى U+FEFF، وفيهما كل شكل من أشكال الحرف مخزَّن كرمز مستقل. هذان النطاقان موجودان فقط للتوافق مع ترميزات قديمة، ويونيكود ينص صراحة على أنهما لا يصلحان لتبادل النصوص الجديدة.
بعض أدوات التصدير الرديئة تحل مشكلة التشكيل بطريقة كسولة: تحوّل نصك مسبقًا إلى نماذج العرض هذه، وترتبه بصريًا من اليسار إلى اليمين، ثم تكتبه في الملف. النتيجة تبدو صحيحة تمامًا على الشاشة، لأن كل حرف مرسوم بشكله النهائي في مكانه الصحيح. لكن النص المخزَّن أصبح سلسلة رموز عرض معكوسة الترتيب. أي محرك بحث أو محلل سيرة ذاتية يقرأ هذا الملف يحصل على شيء لا يشبه العربية إطلاقًا.
Tip: القاعدة العملية: لا تحكم أبدًا على ملف PDF عربي بالنظر إليه. الحكم الوحيد الموثوق هو نسخ النص منه ولصقه في مكان آخر. العين تُخدع، والحافظة لا تُخدع.
اختبار الدقيقتين الذي يكشف الملف المعطوب
قبل أن تغيّر خطًا واحدًا أو إعدادًا واحدًا، افحص الملف الذي بين يديك الآن. هذه الخطوات الخمس تكشف الأعطال الثلاثة جميعها، ولا تحتاج إلى أي برنامج مدفوع.
- افتح الـ PDF في برنامج غير الذي صدّرته منه. متصفح كروم أو إيدج أو Adobe Acrobat Reader المجاني. لا تفتحه في وورد، لأن وورد يعيد بناء الملف ويخفي العطل.
- اضغط Ctrl+F داخل القارئ وابحث عن كلمة تعرف وجودها، مثل اسمك الأول أو كلمة "الخبرات". إذا لم يجدها القارئ، فلن يجدها أي نظام توظيف. هذا وحده يفصل بين ملف سليم وملف ميت.
- حدّد كل النص بـ Ctrl+A، انسخه، والصقه في محرر نصوص بسيط مثل Notepad أو TextEdit في وضع النص العادي. إذا ظهرت الحروف مفككة أو معكوسة الترتيب هناك بينما كانت سليمة في القارئ، فأنت أمام نماذج عرض مخزنة بدل الحروف الأساسية.
- في Acrobat Reader افتح File ثم Properties ثم تبويب Fonts. كل خط في القائمة يجب أن يكون مكتوبًا بجانبه Embedded أو Embedded Subset. أي خط بلا هذه الكلمة يعني أن جهاز المستقبل سيستبدله بخط آخر، وقد ينهار التشكيل عندها.
- انظر إلى حجم الملف. سيرة ذاتية من صفحتين بلا صور يجب أن تكون في حدود بضع مئات من الكيلوبايت. إذا كانت ثلاثة أو أربعة ميغابايت فالأرجح أن النص تحوّل إلى صورة، ومعنى ذلك أن محتواه النصي يساوي صفرًا.
إذا نجح ملفك في الخطوات الخمس فلا تغيّر شيئًا. وإذا سقط في أي منها فتابع القراءة.
الأرقام والتواريخ وأرقام الهاتف: العطل الذي لا يلاحظه أحد
هذا أكثر عطل يمر دون انتباه في السير الذاتية العربية، لأنه لا يشوّه الحروف بل يقلب المعنى. السبب خوارزمية الاتجاه الثنائي في يونيكود، الموصوفة في تقرير UAX #9. الخوارزمية تصنف كل رمز إلى نوع اتجاهي: الحروف العربية قوية يمينية، والأرقام أنواع ضعيفة تتلوّن بمحيطها. والقاعدة W2 في التقرير تنص على أن الرقم الأوروبي، أي الأرقام 0 إلى 9 اللاتينية، يتحول تصنيفه إلى رقم عربي حين يسبقه حرف عربي.
النتيجة العملية أن كل رقم يحتفظ داخليًا بقراءته من اليسار إلى اليمين، لكن ترتيب الأرقام فيما بينها يتبع اتجاه الفقرة العربية من اليمين إلى اليسار. لذلك حين تكتب مدة وظيفة على هيئة "2020 - 2024" داخل فقرة عربية، تظهر بصريًا "2024 - 2020". أنت كتبت البداية ثم النهاية، والقارئ يرى النهاية ثم البداية. لن يشك أحد في أن هذا خلل تقني، بل سيقرأها كما هي ويستنتج أنك لا تعرف ترتيب تواريخك.
العطل نفسه يضرب أرقام الهاتف. علامة الزائد في "+966 50 123 4567" مصنفة كمُنهٍ أوروبي، وفي محيط عربي تنفصل عن الرقم وتقفز إلى الطرف الآخر، فيظهر الرقم بصورة تجعل التحقق منه في نموذج التقديم يفشل. والمسافات بين مجموعات الأرقام تفاقم المشكلة لأنها تقسّم الرقم إلى مقاطع مستقلة يعيد المحرك ترتيبها.
- اكتب مدى التاريخ بلا مسافات حول الشرطة: 2020-2024. المقطع كله يصبح وحدة واحدة فلا يُعاد ترتيبه.
- أو استبدل الشرطة بكلمات عربية صريحة: من 2020 إلى 2024. هذا أوضح للقارئ البشري وأكثر أمانًا للمحلل الآلي معًا.
- اكتب رقم الهاتف بلا مسافات ولا أقواس: +966501234567. رقم واحد متصل لا يمكن تقطيعه.
- إن أصر برنامجك على قلب الرقم، ضع علامة U+200E وهي علامة اليسار إلى اليمين قبل الرقم مباشرة. رمز غير مرئي بلا عرض، لكنه يثبّت اتجاه ما بعده. في وورد تُدرج من Insert ثم Symbol ثم Special Characters.
- البديل الأحدث والأنظف هو محرفا العزل U+2066 و U+2069، يُوضع الأول قبل النص اللاتيني والثاني بعده فيصبح المقطع معزولًا عن محيطه في الاتجاهين. دعمه أوسع في المتصفحات منه في برامج المكاتب القديمة.
يبقى سؤال شكل الأرقام نفسه. الأرقام العربية الهندية ٠١٢٣٤٥٦٧٨٩ صحيحة لغويًا وجميلة بصريًا، لكنها خيار سيئ في سيرة ذاتية تُرفع إلى منصة توظيف. أدوات التحقق من صيغة الهاتف والبريد وتواريخ الخبرة في معظم أنظمة التوظيف مبنية على الأرقام اللاتينية، والرقم المكتوب بالأرقام الهندية يُرفض في حقول كثيرة أو يُقرأ فارغًا. استخدم الأرقام اللاتينية في كل مكان من السيرة الذاتية: التواريخ، الهاتف، النسب المئوية، وأي رقم في وصف إنجاز.
Tip: في وورد لويندوز، إن ظهرت أرقامك هندية رغم أنك تكتبها لاتينية، افتح File ثم Options ثم Advanced، وابحث في قسم Show document content عن خيار Numeral واضبطه على Arabic. التسمية مربكة: خيار Arabic هنا يعني الأرقام اللاتينية 0-9، وخيار Hindi يعني ٠-٩. الخيار لا يظهر إلا بعد تفعيل لغة تحرير من اليمين إلى اليسار.
الخطوط التي تنجو والخطوط التي تُسقط ملفك
الخط ليس مسألة ذوق هنا بل مسألة بنية. الخط العربي الصالح للتصدير يحتاج ثلاثة أشياء: جداول OpenType كاملة للتشكيل، وترخيصًا يسمح بالتضمين داخل الملف، وتغطية للمحارف التي تستخدمها فعلًا. كثير من الخطوط العربية المجانية المنتشرة على مواقع تجميع الخطوط تفتقر إلى الأول، وبعض الخطوط التجارية القديمة يمنع الثاني.
- خيارات آمنة ومفتوحة الترخيص: Noto Naskh Arabic و Noto Sans Arabic و Noto Kufi Arabic من جوجل، جميعها برخصة SIL Open Font License وتغطيتها للمحارف واسعة جدًا وجداول التشكيل فيها كاملة.
- خيارات حديثة الشكل: IBM Plex Sans Arabic و Cairo و Tajawal و Almarai، كلها برخصة مفتوحة وتصدَّر بلا مشاكل، وتناسب سيرة ذاتية عصرية أكثر من خطوط النسخ التقليدية.
- خط Amiri جميل جدًا للطباعة لكنه غني بالتراكيب والتشابكات، وبعض أدوات استخراج النص تتعثر في فك تراكيبه. اتركه للنصوص المطبوعة لا لملف يمر على محلل آلي.
- انتبه للخطوط القديمة المرفقة مع أنظمة التشغيل مثل Traditional Arabic و Simplified Arabic و Arabic Transparent. بعض نسخها تحمل قيود تضمين، والنتيجة أن الخط لا يُضمَّن ويُستبدل عند فتح الملف على جهاز آخر.
- تجنّب تمامًا الخطوط الزخرفية المجانية مجهولة المصدر. الخط الذي بلا جداول init و medi و fina سيعطيك حروفًا مفككة في أي محرك لا يعوّض عنه.
وقاعدة أخيرة: استخدم خطًا عربيًا واحدًا في الملف كله، وخطًا لاتينيًا واحدًا للمصطلحات الإنجليزية. كل خط إضافي نقطة فشل إضافية عند التضمين.
إعدادات التصدير الصحيحة، برنامجًا برنامجًا
الطريقة التي تخرج بها الملف تحدد النتيجة أكثر من الخط نفسه. في مايكروسوفت وورد، لا تستخدم أمر الطباعة إلى Microsoft Print to PDF مطلقًا، لأنه يعامل المستند كصفحة طباعة وينتج ملفًا بلا بنية وبخريطة محارف ناقصة في أحيان كثيرة. استخدم File ثم Save As واختر PDF من قائمة نوع الملف، ثم اضغط زر Options واضبط ما يلي.
- فعّل خيار Document structure tags for accessibility. هذا ينتج ملفًا موسومًا يحفظ ترتيب القراءة المنطقي، وهو تحديدًا ما يحتاجه أي محلل نصوص ليقرأ العربية بالترتيب الصحيح لا بالترتيب البصري.
- ألغِ تفعيل Bitmap text when fonts may not be embedded. هذا الخيار يبدو مطمئنًا لكنه الأخطر: حين يعجز وورد عن تضمين خطك يحوّل النص إلى صورة نقطية، فتحصل على ملف جميل المظهر خالٍ من أي نص قابل للقراءة.
- اختر Standard في خانة Optimize for، لا Minimum size. الضغط الزائد يضر بجودة تضمين الخطوط.
- خيار ISO 19005-1 compliant وهو معيار PDF/A يفرض تضمين كل الخطوط داخل الملف. فعّله إن كنت تشك في مشكلة تضمين، وافحص بعده تبويب Fonts للتأكد.
في مستندات جوجل، فعّل أدوات اليمين إلى اليسار من الإعدادات أولًا واضبط اتجاه كل فقرة عربية صراحة، ثم صدّر عبر File ثم Download ثم PDF Document. مستندات جوجل تتعامل مع التشكيل والاتجاه بمحرك حديث ونتائجها عادة سليمة، لكن الفقرات التي تُركت باتجاه افتراضي من اليسار إلى اليمين ستخرج بمحاذاة وترتيب خاطئين.
في ليبر أوفيس رايتر، الخطوة الحاسمة تسبق الكتابة: افتح Tools ثم Options ثم قسم اللغات، وفعّل دعم التخطيط النصي المعقد المعروف بـ CTL واضبط لغته على العربية. بدون هذا التفعيل لن يطبَّق التشكيل أصلًا مهما كان الخط. ثم صدّر عبر File ثم Export as PDF، ومن التبويب العام فعّل خيار Tagged PDF.
أما أدوات التصميم على الإنترنت فهي الفخ الأكبر. كثير منها يرسم النص على لوحة رسومية ثم يصدّره كمسارات متجهة أو صورة، فتحصل على ملف بديع بصريًا وخالٍ تمامًا من النص. طبّق اختبار البحث بـ Ctrl+F على مخرجاتها فورًا. وإن استخدمت LaTeX فالمسار المعقول للعربية هو XeLaTeX أو LuaLaTeX مع حزم الاتجاه المناسبة، لا pdfLaTeX.
العمودان: لماذا يفكّك التصميم الجميل ملفك عند القراءة الآلية
التخطيط ذو العمودين، بشريط جانبي للمهارات واللغات ومنطقة رئيسية للخبرات، هو الشكل الأكثر شيوعًا في قوالب السير الذاتية. المشكلة أن ملف PDF لا يخزّن أعمدة، بل يخزّن كتل نص بإحداثيات على الصفحة. المحلل الآلي يعيد بناء ترتيب القراءة بالتخمين، وحين يخطئ التخمين تتداخل الكتل: تجد مهارة من الشريط الجانبي مدسوسة في منتصف وصف وظيفة.
ومع العربية تتضاعف الصعوبة: على المحلل أن يحل مسألتين معًا، أي كتلة تأتي قبل الأخرى، وهل الترتيب داخل الكتلة منطقي أم بصري. يضاف إلى ذلك أن الشريط الجانبي في القوالب العربية يقع يمينًا، وكثير من المحللات مضبوط افتراضيًا على أن العمود الأيسر يأتي أولًا.
- احتفظ بنسخة عمود واحد من سيرتك، وأرسلها في كل تقديم يمر عبر نظام رفع ملفات. احتفظ بالنسخة ذات العمودين للإرسال المباشر بالبريد إلى شخص تعرف اسمه.
- لا تضع معلومات الاتصال في ترويسة الصفحة أو تذييلها. كثير من أدوات الاستخراج تتجاهل الترويسة والتذييل تمامًا، فيصل ملفك بلا هاتف ولا بريد.
- لا تبنِ الأعمدة بمربعات نصية أو أشكال. مربع النص كتلة معزولة قد تُقرأ في غير موضعها أو تُهمل. استخدم جدولًا بلا حدود إن اضطررت، والأفضل تخطيطًا خطيًا بسيطًا.
- لا تضع أي معلومة جوهرية داخل صورة أو رسم بياني أو أيقونة. الأيقونة التي تعني الهاتف لا تُقرأ، والرقم بجانبها هو وحده ما يصل.
هل تقرأ أنظمة تتبع المتقدمين العربية أصلًا؟
الإجابة الدقيقة: تقرؤها كسلسلة محارف، لكنها في الغالب لا تفهمها كلغة. معظم أنظمة تتبع المتقدمين المستخدمة في الشركات الكبرى في المنطقة أنظمة عالمية بُنيت حول اللغة الإنجليزية، ومطابقة الكلمات المفتاحية فيها تعتمد على تطابق نصي بسيط بعد تقطيع بالمسافات. لا يوجد ضمان بوجود تطبيع للنص العربي في المنتصف، وهذا يخلق فروقًا عملية مهمة.
- التطويل، أي المحرف U+0640 الذي يُمد به الحرف لتجميل السطر، يكسر أي تطابق نصي. كلمة ممدودة لا تساوي الكلمة نفسها غير ممدودة. امسح التطويل من الملف كله عبر البحث والاستبدال.
- التشكيل، أي الحركات في النطاق U+064B إلى U+0652، يفعل الشيء نفسه. لا تشكّل سيرتك الذاتية إطلاقًا.
- صور الألف: أ و إ و آ و ا. من يبحث عن "إدارة" قد لا يجد "ادارة". اكتب الهمزات بشكلها الصحيح المعياري ولا تهملها.
- التاء المربوطة والهاء: "إدارة" لا تساوي "اداره" في أي مطابقة حرفية. دقق في نهايات الكلمات.
- المسميات الوظيفية وأسماء الأدوات: اكتبها بالإنجليزية بجانب العربية حين تكون معروفة بالإنجليزية أصلًا. مثال: "مدير مشاريع Project Manager" أو "تحليل البيانات باستخدام Power BI". قوائم الكلمات المفتاحية عند أغلب الشركات متعددة الجنسيات إنجليزية.
وتبقى تفصيلة تُنسى دائمًا: اسم الملف. الاسم العربي قد يُرمَّز أو يُشوَّه عند الرفع على بعض المنصات فيصل كسلسلة رموز. سمِّ الملف بحروف لاتينية مثل Ahmed-Alharbi-CV.pdf.
قائمة الفحص الأخيرة قبل الإرسال
مرّ على هذه القائمة مرة واحدة على النسخة النهائية. إن اجتازتها كلها، فالملف الذي يصل هو الملف الذي كتبته.
- فتحت الملف في متصفح أو في Acrobat Reader، لا في وورد.
- بحثت داخله عن كلمة عربية بـ Ctrl+F ووجدها القارئ.
- نسخت النص ولصقته في محرر نصوص بسيط وظهر موصولًا وبالترتيب الصحيح.
- كل الخطوط في تبويب Fonts مكتوب بجانبها Embedded أو Embedded Subset.
- الأرقام كلها لاتينية، ومدى التاريخ يُقرأ من الأقدم إلى الأحدث، ورقم الهاتف يظهر بترتيبه الصحيح.
- حجم الملف بضع مئات من الكيلوبايت لا عدة ميغابايت.
- معلومات الاتصال في متن الصفحة لا في الترويسة أو التذييل.
- لا تطويل ولا تشكيل في أي سطر.
- اسم الملف بحروف لاتينية.
الفارق بين سيرة ذاتية تصل وسيرة تختفي في هذه الحالة ليس فارقًا في الخبرة ولا في الصياغة. إنه فارق في طبقة تقنية لا يراها المتقدم أبدًا، لأنه الوحيد الذي يفتح الملف على الجهاز الذي كتبه عليه. دقيقتان من الفحص قبل الإرسال تكشف عطلًا كان سيكلفك عشرات الطلبات.
مقالات ذات صلة
- ChatGPT لكتابة السيرة الذاتية: أين ينجح وأين يفشل
- أدوات فحص السيرة الذاتية الأجنبية لا تقرأ العربية
- التاريخ الهجري والميلادي في السيرة الذاتية: القاعدة
- ترجمة المسمى الوظيفي: 40 مسمى عربي بمقابله الدقيق