تست A/B چیست؟
تست A/B یک آزمایش است که در آن دو نسخه از یک چیز—مثل یک صفحه وب، یک کامپوننت رابط کاربری، یک تغییر در متن (copy variation) یا یک جریان فیچر—با هم مقایسه میشوند. این کار به این شکل انجام میشود که یک نسخه به نیمی از کاربران نمایش داده میشود و نسخه دیگر به نیمهی دیگر، سپس مشخص میشود کدام نسخه بهتر به یک هدف مشخص دست پیدا میکند.
این دو نسخه معمولاً A (نسخه کنترل که اغلب همان نسخه فعلی است) و B (نسخه جایگزین که تغییر پیشنهادی است) نامیده میشوند. کاربران بهصورت تصادفی در یکی از این دو گروه قرار میگیرند و این تخصیص در طول آزمایش ثابت میماند تا هر کاربر همیشه یک نسخه یکسان را تجربه کند. در پایان آزمایش، معیار مورد نظر بین دو گروه مقایسه میشود. اگر تفاوت از نظر آماری معنادار باشد، تیم میتواند آن را به تغییر ایجادشده نسبت دهد، نه به نوسان تصادفی.
تست A/B به یک سؤال مشخص و مهم پاسخ میدهد: وقتی X را تغییر میدهیم، آیا رفتار کاربر در معیار Y بهبود پیدا میکند؟ اما به ما نمیگوید چرا کاربران متفاوت رفتار میکنند یا درباره تغییر چه فکری میکنند. این نقش تحقیقات کیفی است. تست A/B و تحقیق کاربری مکمل یکدیگرند، نه جایگزین هم.
چه نوع تغییراتی معمولاً در A/B تست بررسی میشوند؟
تست A/B تقریباً روی هر متغیری در یک محصول دیجیتال قابل اجراست، اما برخی دستهها بیشتر از بقیه تست میشوند.
- تغییرات متن و پیام (Copy & Messaging) بررسی میکنند که آیا انتخاب واژههای متفاوت رفتار متفاوتی ایجاد میکند یا نه. عناوین دکمهها (مثل “Sign up” در برابر “Get started”)، تیترها، ارزش پیشنهادی و متن CTA از رایجترین موارد هستند. این تستها معمولاً کمهزینهاند و میتوانند تغییرات قابلتوجهی در نرخ تبدیل ایجاد کنند.
- تغییرات بصری و چیدمان (Visual & Layout) بررسی میکنند که تغییرات طراحی چگونه روی رفتار اثر میگذارند. این شامل رنگ دکمه، جایگاه عناصر کلیدی، وجود یا عدم وجود المانهایی مثل تصویر یا نشانههای اعتماد، ساختار صفحه و سلسلهمراتب بصری اطلاعات است. مورد معروف Microsoft Bing که یک تغییر در چیدمان نتایج جستجو سالانه 100 میلیون دلار درآمد اضافی ایجاد کرد، نمونهای از تأثیر تغییرات ظاهراً کوچک است.
- تغییرات جریان و ناوبری (Flow & Navigation) بررسی میکنند که ساختارهای مختلف انجام یک کار آیا نرخ تکمیل بهتری ایجاد میکنند یا نه. کم کردن مراحل checkout، تغییر ترتیب سوالات onboarding یا سادهسازی فرم ثبتنام از تستهای رایج این دسته هستند.
- Feature flags و rolloutها از تست A/B برای نمایش یک ویژگی جدید به بخشی از کاربران قبل از انتشار کامل استفاده میکنند. این کار کمک میکند قبل از انتشار عمومی مطمئن شویم ویژگی جدید واقعاً معیار مورد نظر را بهبود میدهد و در صورت مشکل، ریسک را محدود میکند.
معناداری آماری در تست A/B یعنی چه؟
معناداری آماری مفهومی است که مشخص میکند آیا تفاوت مشاهدهشده بین گروه A و B واقعی است یا ممکن است صرفاً بهصورت تصادفی رخ داده باشد، حتی اگر دو نسخه واقعاً تفاوتی نداشته باشند.
در اغلب تستهای A/B، آستانه استاندارد p < 0.05 است؛ یعنی کمتر از ۵٪ احتمال وجود دارد که این تفاوت فقط ناشی از شانس باشد. وقتی تست به این سطح برسد، گفته میشود با سطح اطمینان ۹۵٪ معنادار است. بعضی تیمها برای تصمیمهای حساستر از ۹۹٪ اطمینان (p < 0.01) استفاده میکنند.
معناداری آماری هیچ چیزی درباره اندازه اثر نمیگوید. ممکن است تفاوتی از نظر آماری معنادار باشد اما در عمل بسیار کوچک و بیاهمیت باشد، مخصوصاً وقتی حجم نمونه زیاد است. تشخیص اینکه این تفاوت «واقعاً ارزش اقدام دارد یا نه» یک تصمیم جداگانه است.
اندازه نمونه تعیین میکند که تست با چه سرعتی به معناداری میرسد. ترافیک کم رسیدن به نتیجه را سختتر میکند و نیاز به زمان بیشتر یا اثر بزرگتر دارد. ابزارهای محاسبه نمونه (در پلتفرمهای تست) کمک میکنند زمان لازم برای رسیدن به نتیجه تخمین زده شود.
یک اشتباه رایج، متوقف کردن تست به محض رسیدن به معناداری است (peeking). چون تحلیل آماری برای بررسی در یک نقطه مشخص طراحی شده، نگاه مداوم و توقف زودهنگام نرخ خطای مثبت کاذب را بالا میبرد. تست باید از قبل با حجم نمونه مشخص طراحی شود و تا انتها اجرا شود.
تست A/B در یک سیستم تحقیقاتی بزرگتر چگونه قرار میگیرد؟
تست A/B فقط یکی از ابزارهای یک سیستم بزرگتر است و باید محدودیتهای آن را شناخت.
این روش برای اندازهگیری رفتار کاربران در مقیاس بالا عالی است و دقیقاً نشان میدهد آیا یک تغییر روی رفتار قابل اندازهگیری اثر گذاشته یا نه. اما نمیگوید چرا این اتفاق افتاده یا کاربران چه احساسی داشتهاند. ممکن است یک تغییر نرخ تبدیل را بالا ببرد اما همزمان رضایت یا درک برند را کاهش دهد و در بلندمدت روی نگهداشت اثر منفی بگذارد.
تحقیقات کاربری مثل تست usability، مصاحبه و نظرسنجی، زمینه کیفی لازم را فراهم میکنند تا نتایج تست A/B قابل تفسیر شوند. وقتی نسخه B عملکرد بدتری دارد، تحقیق کمک میکند دلیل آن مشخص شود. همچنین قبل از طراحی تستهای گران، میتواند مسیرهای احتمالی را محدود کند.
تحلیل داده (Analytics) نیز منبع اصلی فرضیهها برای تستهای A/B است. بررسی نقاط ریزش کاربر، ویژگیهای کماستفاده یا صفحات با نرخ خروج بالا، مشخص میکند چه چیزی ارزش تست کردن دارد. تیمهای موفق تست A/B را بهعنوان بخشی از یک فرهنگ آزمایش مداوم اجرا میکنند، نه یک فعالیت مقطعی. شرکتهایی مثل Amazon، Netflix و Google هزاران تست را همزمان اجرا میکنند و اثر تجمعی این بهینهسازیهای کوچک در طول زمان بسیار بزرگ است.