“نسخة B عندها معدّل تحويل أعلى نسبة 30٪ من A — لازم أوقف A فوراً!” هذا القرار قد يكون خاطئاً تماماً إن كان الفرق ناتجاً عن الصدفة لا عن تفوّق حقيقي، خصوصاً على عيّنة صغيرة. هذا الدليل يشرح كيف تصمّم اختبار A/B صحيحاً من الأساس، وكيف تقرأ نتائجه بمنهجية إحصائية فعلية لا بتخمين بصري للفرق — مع حاسبة جاهزة تطبّق هذه المنهجية مباشرة.
الخطوة الأولى: اختبار متغيّر واحد فقط في كل مرة
الخطأ الأشيع هو تغيير العنوان والصورة والزر في نفس الوقت ثم محاولة معرفة أي عنصر سبّب الفرق. إذا تغيّرت عدة عناصر معاً، لن تعرف أبداً أيّها سبّب التحسن أو التراجع الفعلي. اختر متغيّراً واحداً ذا أثر محتمل (العنوان، زر الدعوة، الصورة الرئيسية) واختبره وحده حتى تعرف بدقة ما الذي أحدث الفرق.
الخطوة الثانية: حجم العيّنة قبل البدء لا بعده
أكبر خطأ منهجي في اختبارات A/B هو الحكم مبكّراً قبل وصول عيّنة كافية. لا رقم ثابت مطلق يناسب كل حالة، لكن كقاعدة عملية: لا تحكم قبل وصول كل نسخة لما لا يقل عن 300-500 زائر وما لا يقل عن 20-30 تحويلاً على الأقل لكل نسخة. فرق 30٪ على 20 زائراً فقط قد يكون نتيجة تذبذب عشوائي بحت، بينما فرق 10٪ على 5000 زائر يكون موثوقاً جداً.
الخطوة الثالثة: اقرأ النتيجة بالدلالة الإحصائية لا بالانطباع
| المخرَج | يجيب عن |
|---|---|
| معدّل التحويل لكل نسخة | الرقم الخام لكل نسخة على حدة |
| Z-Score | حجم الفرق بوحدات الانحراف المعياري (اختبار نسبتين إحصائي فعلي) |
| القيمة الاحتمالية (p-value) | احتمال أن يكون الفرق الملحوظ مجرد صدفة |
| دلالة إحصائية (95٪)؟ | إجابة مباشرة: نعم موثوقة، أو لا استمر بجمع بيانات |
الأرقام الثلاثة الأخيرة محسوبة بمعادلة Two-Proportion Z-Test القياسية: نسبة مجمّعة (Pooled Proportion)، خطأ معياري (Standard Error)، ثم Z-Score ومنه p-value عبر دالة التوزيع الطبيعي القياسي.
القاعدة العملية الأهم: عيّنة أقل من ~300 زائر لكل نسخة تجعل أي نتيجة غير موثوقة مهما بدا الفرق كبيراً وواضحاً. الحاسبة لا تمنعك من القراءة المبكرة، لكن عمود “الدلالة الإحصائية” سيقول لك بصراحة إن كان القرار مبكّراً جداً.
الخطأ الأخطر: إيقاف الاختبار عند أول نتيجة تبدو جيدة
فرق 30٪ على 20 زائراً لكل نسخة قد يكون نتيجة تذبذب عشوائي بحت — لو أعدت الاختبار لأسبوع آخر قد تنعكس النتيجة كلياً. القاعدة: حدّد حجم العيّنة المستهدف مسبقاً (قبل بدء الاختبار)، واستمر حتى تصل له، لا أن تتوقّف فور رؤية فرق يبدو مرضياً في اللحظة الأولى.
لماذا “الفرق يبدو كبيراً” لا يكفي وحده؟
الرقم النسبي وحده مضلّل بلا اعتبار حجم العيّنة، وهذا بالضبط ما تحسمه القيمة الاحتمالية بدل الانطباع البصري للفرق.
الحاسبة الجاهزة: طبّق المنهجية مباشرة
أدخل عدد الزوار والتحويلات لكل نسخة في الخلايا الصفراء فقط — الباقي (Z-Score وp-value ومستوى الثقة) محسوب تلقائياً بمعادلة إحصائية قياسية (Two-Proportion Z-Test)، مع شيت “دليل تفسير النتائج” يشرح كل حالة محتملة.
⬇ تحميل حاسبة اختبار A/B (Excel)
أسئلة شائعة
ما حجم العيّنة الكافي لاختبار موثوق؟
لا رقم ثابت مطلق، لكن كقاعدة عملية: لا تحكم قبل وصول كل نسخة لما لا يقل عن 300-500 زائر و 20-30 تحويلاً على الأقل.
ماذا أفعل إن كانت النتيجة “غير ذات دلالة”؟
استمر بتشغيل الاختبار لجمع بيانات أكثر قبل اتخاذ أي قرار نهائي; إيقاف الاختبار مبكراً على نتيجة غير حاسمة يعني قراراً عشوائياً فعلياً لا مبنياً على بيانات.
هل تصلح الحاسبة لاختبار أكثر من نسختين معاً؟
هذه النسخة مصمّمة لمقارنة نسختين (A/B) فقط; اختبار عدة نسخ معاً (Multivariate) يحتاج منهجية إحصائية مختلفة وأوسع.
مقالات ذات صلة
- ما معنى CTR؟ ولماذا يخدعك الرقم المرتفع
- قراءة تقارير مدير الإعلانات
- قائمة فحص شاملة قبل إطلاق أي حملة · معجم المصطلحات
للتطبيق العملي: دورة إعلانات فيسبوك وإنستغرام بالعربي.




