تست A/B

در این روش دو نسخه از یک طراحی یا ویژگی را با هم مقایسه می‌کنی تا بر اساس رفتار واقعی کاربران و داده‌ها مشخص شود کدام عملکرد بهتری دارد و تصمیم‌های طراحی دقیق‌تری بگیری.

تست A/B چیست؟

تست A/B یک آزمایش است که در آن دو نسخه از یک چیز—مثل یک صفحه وب، یک کامپوننت رابط کاربری، یک تغییر در متن (copy variation) یا یک جریان فیچر—با هم مقایسه می‌شوند. این کار به این شکل انجام می‌شود که یک نسخه به نیمی از کاربران نمایش داده می‌شود و نسخه دیگر به نیمه‌ی دیگر، سپس مشخص می‌شود کدام نسخه بهتر به یک هدف مشخص دست پیدا می‌کند.

این دو نسخه معمولاً A (نسخه کنترل که اغلب همان نسخه فعلی است) و B (نسخه جایگزین که تغییر پیشنهادی است) نامیده می‌شوند. کاربران به‌صورت تصادفی در یکی از این دو گروه قرار می‌گیرند و این تخصیص در طول آزمایش ثابت می‌ماند تا هر کاربر همیشه یک نسخه یکسان را تجربه کند. در پایان آزمایش، معیار مورد نظر بین دو گروه مقایسه می‌شود. اگر تفاوت از نظر آماری معنادار باشد، تیم می‌تواند آن را به تغییر ایجادشده نسبت دهد، نه به نوسان تصادفی.

تست A/B به یک سؤال مشخص و مهم پاسخ می‌دهد: وقتی X را تغییر می‌دهیم، آیا رفتار کاربر در معیار Y بهبود پیدا می‌کند؟ اما به ما نمی‌گوید چرا کاربران متفاوت رفتار می‌کنند یا درباره تغییر چه فکری می‌کنند. این نقش تحقیقات کیفی است. تست A/B و تحقیق کاربری مکمل یکدیگرند، نه جایگزین هم.


چه نوع تغییراتی معمولاً در A/B تست بررسی می‌شوند؟

تست A/B تقریباً روی هر متغیری در یک محصول دیجیتال قابل اجراست، اما برخی دسته‌ها بیشتر از بقیه تست می‌شوند.

  • تغییرات متن و پیام (Copy & Messaging) بررسی می‌کنند که آیا انتخاب واژه‌های متفاوت رفتار متفاوتی ایجاد می‌کند یا نه. عناوین دکمه‌ها (مثل “Sign up” در برابر “Get started”)، تیترها، ارزش پیشنهادی و متن CTA از رایج‌ترین موارد هستند. این تست‌ها معمولاً کم‌هزینه‌اند و می‌توانند تغییرات قابل‌توجهی در نرخ تبدیل ایجاد کنند.
  • تغییرات بصری و چیدمان (Visual & Layout) بررسی می‌کنند که تغییرات طراحی چگونه روی رفتار اثر می‌گذارند. این شامل رنگ دکمه، جایگاه عناصر کلیدی، وجود یا عدم وجود المان‌هایی مثل تصویر یا نشانه‌های اعتماد، ساختار صفحه و سلسله‌مراتب بصری اطلاعات است. مورد معروف Microsoft Bing که یک تغییر در چیدمان نتایج جستجو سالانه 100 میلیون دلار درآمد اضافی ایجاد کرد، نمونه‌ای از تأثیر تغییرات ظاهراً کوچک است.
  • تغییرات جریان و ناوبری (Flow & Navigation) بررسی می‌کنند که ساختارهای مختلف انجام یک کار آیا نرخ تکمیل بهتری ایجاد می‌کنند یا نه. کم کردن مراحل checkout، تغییر ترتیب سوالات onboarding یا ساده‌سازی فرم ثبت‌نام از تست‌های رایج این دسته هستند.
  • Feature flags و rolloutها از تست A/B برای نمایش یک ویژگی جدید به بخشی از کاربران قبل از انتشار کامل استفاده می‌کنند. این کار کمک می‌کند قبل از انتشار عمومی مطمئن شویم ویژگی جدید واقعاً معیار مورد نظر را بهبود می‌دهد و در صورت مشکل، ریسک را محدود می‌کند.

معناداری آماری در تست A/B یعنی چه؟

معناداری آماری مفهومی است که مشخص می‌کند آیا تفاوت مشاهده‌شده بین گروه A و B واقعی است یا ممکن است صرفاً به‌صورت تصادفی رخ داده باشد، حتی اگر دو نسخه واقعاً تفاوتی نداشته باشند.

در اغلب تست‌های A/B، آستانه استاندارد p < 0.05 است؛ یعنی کمتر از ۵٪ احتمال وجود دارد که این تفاوت فقط ناشی از شانس باشد. وقتی تست به این سطح برسد، گفته می‌شود با سطح اطمینان ۹۵٪ معنادار است. بعضی تیم‌ها برای تصمیم‌های حساس‌تر از ۹۹٪ اطمینان (p < 0.01) استفاده می‌کنند.

معناداری آماری هیچ چیزی درباره اندازه اثر نمی‌گوید. ممکن است تفاوتی از نظر آماری معنادار باشد اما در عمل بسیار کوچک و بی‌اهمیت باشد، مخصوصاً وقتی حجم نمونه زیاد است. تشخیص اینکه این تفاوت «واقعاً ارزش اقدام دارد یا نه» یک تصمیم جداگانه است.

اندازه نمونه تعیین می‌کند که تست با چه سرعتی به معناداری می‌رسد. ترافیک کم رسیدن به نتیجه را سخت‌تر می‌کند و نیاز به زمان بیشتر یا اثر بزرگ‌تر دارد. ابزارهای محاسبه نمونه (در پلتفرم‌های تست) کمک می‌کنند زمان لازم برای رسیدن به نتیجه تخمین زده شود.

یک اشتباه رایج، متوقف کردن تست به محض رسیدن به معناداری است (peeking). چون تحلیل آماری برای بررسی در یک نقطه مشخص طراحی شده، نگاه مداوم و توقف زودهنگام نرخ خطای مثبت کاذب را بالا می‌برد. تست باید از قبل با حجم نمونه مشخص طراحی شود و تا انتها اجرا شود.


تست A/B در یک سیستم تحقیقاتی بزرگ‌تر چگونه قرار می‌گیرد؟

تست A/B فقط یکی از ابزارهای یک سیستم بزرگ‌تر است و باید محدودیت‌های آن را شناخت.

این روش برای اندازه‌گیری رفتار کاربران در مقیاس بالا عالی است و دقیقاً نشان می‌دهد آیا یک تغییر روی رفتار قابل اندازه‌گیری اثر گذاشته یا نه. اما نمی‌گوید چرا این اتفاق افتاده یا کاربران چه احساسی داشته‌اند. ممکن است یک تغییر نرخ تبدیل را بالا ببرد اما هم‌زمان رضایت یا درک برند را کاهش دهد و در بلندمدت روی نگهداشت اثر منفی بگذارد.

تحقیقات کاربری مثل تست usability، مصاحبه و نظرسنجی، زمینه کیفی لازم را فراهم می‌کنند تا نتایج تست A/B قابل تفسیر شوند. وقتی نسخه B عملکرد بدتری دارد، تحقیق کمک می‌کند دلیل آن مشخص شود. همچنین قبل از طراحی تست‌های گران، می‌تواند مسیرهای احتمالی را محدود کند.

تحلیل داده (Analytics) نیز منبع اصلی فرضیه‌ها برای تست‌های A/B است. بررسی نقاط ریزش کاربر، ویژگی‌های کم‌استفاده یا صفحات با نرخ خروج بالا، مشخص می‌کند چه چیزی ارزش تست کردن دارد. تیم‌های موفق تست A/B را به‌عنوان بخشی از یک فرهنگ آزمایش مداوم اجرا می‌کنند، نه یک فعالیت مقطعی. شرکت‌هایی مثل Amazon، Netflix و Google هزاران تست را هم‌زمان اجرا می‌کنند و اثر تجمعی این بهینه‌سازی‌های کوچک در طول زمان بسیار بزرگ است.

سوالات متداول

تست چندمتغیره (Multivariate Testing) چیست و چه تفاوتی با A/B تست دارد؟
تست چندمتغیره چندین متغیر را به‌صورت هم‌زمان و در ترکیب‌های مختلف بررسی می‌کند، نه فقط دو نسخه ساده. به‌جای مقایسه‌ی button color A در برابر button color B، ممکن است ترکیب‌هایی از رنگ دکمه، متن دکمه و تیتر صفحه را هم‌زمان تست کند. هدف این است که مشخص شود کدام ترکیب بهترین عملکرد را دارد و آیا بین متغیرها اثرات تعاملی وجود دارد یا نه. نقطه‌ضعف این روش این است که به ترافیک بسیار بیشتری نسبت به A/B تست نیاز دارد، چون کاربران بین تعداد بیشتری از نسخه‌ها تقسیم می‌شوند.
A/B تست باید چقدر اجرا شود؟
به‌اندازه‌ای که حجم نمونه لازم برای رسیدن به معناداری آماری جمع شود و همچنین رفتار کاربران در بازه‌های زمانی مختلف (مثل روزهای هفته) را پوشش دهد. بیشتر تست‌ها باید حداقل یک هفته کامل اجرا شوند تا تغییرات رفتاری روزانه را در نظر بگیرند. مدت دقیق به میزان ترافیک محصول و اندازه اثر مورد انتظار بستگی دارد؛ تغییر کوچک در یک محصول پربازدید ممکن است طی چند روز به نتیجه برسد، اما در محصولات کم‌ترافیک ممکن است هفته‌ها طول بکشد. توقف زودهنگام تست به‌خاطر نتایج اولیه مثبت، یک خطای رایج است که نرخ خطای مثبت کاذب را بالا می‌برد.
آیا A/B تست برای بهبود دسترس‌پذیری (Accessibility) قابل استفاده است؟
A/B تست می‌تواند اثر رفتاری تغییرات دسترس‌پذیری را اندازه‌گیری کند، اما ابزار اصلی برای اعتبارسنجی آن نیست. چون کاربران دارای معلولیت ممکن است بخش کوچکی از ترافیک باشند، A/B تست معمولاً نمی‌تواند اثرات خاص روی آن‌ها را به‌درستی نشان دهد. برای بررسی واقعی دسترس‌پذیری، تست با کاربران دارای معلولیت روش مناسب‌تری است. A/B تست می‌تواند در کنار آن یک سیگنال کمکی بدهد که تغییرات ایجادشده به تجربه عمومی کاربران آسیب نزده است.
وقتی یک A/B تست نتیجه معنادار ندارد چه باید کرد؟
نتیجه‌ی بدون معناداری (null result) کاملاً معتبر است و خودش یک داده محسوب می‌شود؛ یعنی تغییر اعمال‌شده تأثیر قابل‌توجهی روی معیار مورد نظر نداشته است. در این حالت باید فرضیه اولیه بررسی شود: آیا اساساً دلیل درستی برای بهتر بودن نسخه B وجود داشته؟ آیا معیارهای دیگری تغییر کرده‌اند؟ آیا تست به اندازه کافی توان (power) داشته تا اثر واقعی را تشخیص دهد؟ گاهی فرضیه اشتباه بوده و گاهی تست ضعیف طراحی شده؛ هر کدام واکنش متفاوتی می‌طلبد.
تست A/B چه نقشی در تصمیم‌گیری محصول دارد؟
تست A/B خودش تصمیم‌گیر نیست، بلکه فقط شواهدی برای تصمیم‌گیری فراهم می‌کند. اینکه نسخه B بهتر عمل می‌کند به این معنا نیست که حتماً باید منتشر شود، چون عواملی مثل هزینه پیاده‌سازی، پیچیدگی نگهداری، هماهنگی با استراتژی محصول و اثرات خارج از معیار اندازه‌گیری‌شده هم وجود دارند. تیم‌هایی که فقط به نتایج تست برای تصمیم‌گیری تکیه می‌کنند معمولاً محصول را در یک بعد بهینه می‌کنند، اما تیم‌های حرفه‌ای از تست به‌عنوان یکی از ورودی‌های تصمیم‌سازی در کنار سایر داده‌ها استفاده می‌کنند.

برچسب‌ها

تحقیقات کمی, تحقیقات کاربر
با دوستان خود به اشتراک بگذارید.