$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
تم تقييم إطار عمل النمذجة الأولية لواجهة المستخدم المؤتمت المقترح باستخدام مجموعة بيانات متكاملة تضم 5,128 شاشة واجهة مستخدم من ثلاثة مصادر: 4,000 صورة من RICO، و1,000 شاشة من ENRICO، و128 عينة واجهة مستخدم مشروحة بالألوان من مجموعة بيانات Guo's UI Color. توفر مجموعة البيانات المدمجة هذه معياراً متوازناً لتقييم دقة اكتشاف المكونات، ووضوح الهيكل التخطيطي، والاتساق عبر الشاشات المتعددة، والتناغم اللوني الإدراكي.
تُظهر النتائج التجريبية أن نموذج الكشف القائم على Faster R-CNN يحقق دقة في الكشف عن المكونات بنسبة 92.4% ويتعمم بفعالية عبر أنماط متنوعة من واجهات المستخدم للهواتف المحمولة. علاوة على ذلك، فإن دمج تعليقات نمط ENRICO يعزز الاستنتاج الخاص بالتخطيط، مما أدى إلى زيادة بنسبة 18.7% في وضوح التخطيط وتحسين الحفاظ على ترتيب القراءة. وفي تجارب تقييم الألوان، أنتجت وحدة نمذجة الألوان المدفوعة بـ CAM02-UCS لوحات ألوان أكثر تناسقاً بنسبة 24.5% وفقاً لتقييمات المصممين، وحققت اتساقاً إدراكياً أعلى مقارنة بطرق توليد لوحات الألوان التقليدية القائمة على RGB وLAB. فضلاً عن ذلك، حققت نمذجة الاتساق متعدد الشاشات تحسناً بنسبة 28% في المحاذاة عبر الشاشات واتساق الطباعة. وأظهرت دراسات المستخدمين التي شملت 30 مشاركاً انخفاضاً بنسبة 31% في الحمل المعرفي المدرك عند التفاعل مع النماذج الأولية التي أنتجها النظام المقترح. وتشير هذه النتائج مجتمعة إلى أن الجمع بين الكشف عن المكونات، ونمذجة الألوان الإدراكية، والتحسين المعرفي ينتج نماذج أولية لواجهات المستخدم ليست دقيقة هيكلياً فحسب، بل متماسكة بصرياً وفعالة معرفياً أيضاً. ويسلط الجدول 3 الضوء على بيئة المحاكاة والإعدادات التقنية المستخدمة لتقييم إطار عمل النمذجة الأولية لواجهة المستخدم المقترح. وقد تم دعم إجراءات التدريب الكثيفة حسابياً لـ Faster R-CNN ووحدات اتساق التخطيط بواسطة وحدة معالجة رسومات NVIDIA RTX 4090 عالية الأداء. وأُجريت جميع التجارب في بيئة Ubuntu 22.04 باستخدام PyTorch 2.0 لتنفيذ التعلم العميق.
| المَعلَم | التكوين |
| الأجهزة | NVIDIA RTX 4090 GPU (24 GB), Intel i9 Processor, 64 GB RAM |
| نظام التشغيل | Ubuntu 22.04 LTS |
| إطار عمل التعلم العميق | PyTorch 2.0 |
| البنية الأساسية لـ Faster R-CNN | ResNet-50 + FPN |
| دقة الصورة | 480 × 800 (مُوحّدة عبر جميع مجموعات البيانات) |
| حجم دفعة التدريب | 8 |
| المُحسّن | AdamW (LR = 1e−4, Weight Decay = 0.01) |
| عدد الدورات (Epochs) | 40 |
| فضاء نمذجة الألوان | CAM02-UCS |
| التجميع لاستخراج لوحة الألوان | K-means (k = 5) |
| تجميع المخطط | DBSCAN (ε = 20, min_samples = 3) |
الجدول 3: معايير التنفيذ والتكوين التجريبي للإطار المقترح. يلخص الجدول إعدادات الأجهزة والبرامج المستخدمة لتدريب النموذج وتقييمه، بما في ذلك الموارد الحوسبية، ونظام التشغيل، وإطار التعلم العميق، وبنية النموذج، ودقة الصورة، ومعايير التدريب، واستراتيجية التحسين، ومساحة نمذجة الألوان، وطرق التجميع المستخدمة لاستخراج لوحة الألوان وتجميع التخطيط.
تستخدم بنية Faster R-CNN عموداً فقرياً من نوع ResNet-50 مع شبكة هرمية الميزات (FPN) للكشف عن مجموعة واسعة من مكونات واجهة المستخدم دقيقة التفاصيل. يتم تغيير حجم جميع صور واجهة المستخدم بشكل موحد إلى 480 × 800 بكسل قبل المعالجة. يتم إجراء التدريب على مدار 60 حقبة (epochs) باستخدام مُحسِّن SGD، مع حجم دفعة (batch size) يبلغ 16 لضمان التقارب المستقر. يستخدم مولد لوحة الألوان نظام CAM02-UCS مع تجميع K-means، بينما يُستخدم خوارزمية DBSCAN لتجميع التخطيط الهيكلي. تضمن هذه الإعدادات التقنية أن تكون نتائج واجهة المستخدم المولدة قابلة للتكرار ومستقرة وذات دقة عالية. ولتقديم تقييم شامل لإطار عمل النمذجة الأولية المؤتمتة لواجهة المستخدم المقترح، يتم استخدام أربع فئات من مقاييس التقييم:
أ) أداء اكتشاف المكونات، الذي تم تحليله باستخدام الدقة (precision)، والاستدعاء (recall)، ومقياس F1-score، والتقاطع فوق الاتحاد (IoU)، ومتوسط الدقة المتوسطة (mAP)، والتي تحدد بدقة مدى كفاءة نموذج Faster R-CNN في تحديد مكونات واجهة المستخدم عبر مجموعتي بيانات RICO و ENRICO؛
2) وضوح التخطيط والاتساق الهيكلي، ويُقاس ذلك من خلال خطأ المحاذاة (AE)، ودقة التجميع، وصحة ترتيب القراءة، ودرجات الاتساق عبر الشاشات المستمدة من قيود نمط التصميم؛
iii) جودة اللون الإدراكية، والتي تم تقييمها باستخدام المسافة الإدراكية CAM02-UCS (ΔE_UCS)، ونسب تباين WCAG 2.1، ومؤشر التنوع، ودرجات التناغم اللوني المستوحاة من إطار عمل Guo لتقييم ألوان واجهة المستخدم؛
4) مقاييس الكفاءة المعرفية المتمحورة حول المستخدم، بما في ذلك العبء المعرفي المقاس بواسطة مؤشر ناسا لحمل المهام (NASA-TLX)، وتقييمات التماسك الجمالي، وكفاءة إنجاز المهام.
تتيح هذه المقاييس تقييم الإطار العملي ليس فقط من حيث دقة الكشف، بل وأيضاً من حيث التناغم الإدراكي، وجودة سهولة الاستخدام، والتجربة المعرفية.
مقاييس الكشف عن المكونات
تصف الدقة (Precision) مدى إتقان النموذج في التنبؤ بمكونات واجهة المستخدم دون توليد نتائج إيجابية خاطئة. وتعني الدقة العالية أن معظم مربعات الإحاطة المتوقعة تتوافق مع عناصر واجهة مستخدم صالحة. أما الاسترجاع (Recall) فيقيس قدرة النموذج على تحديد جميع مكونات واجهة المستخدم ذات الصلة في الشاشة، حيث يشير الاسترجاع العالي إلى نجاح النموذج في اكتشاف معظم المكونات المرجعية (ground-truth). ويوفر مقياس F1-score، الذي يُعرف بأنه المتوسط التوافقي للدقة والاسترجاع، تقييماً متوازناً ويكون مفيداً بشكل خاص عندما تكون مكونات واجهة المستخدم موزعة بشكل غير متساوٍ عبر مجموعات البيانات.
يقيس مقياس IoU مدى تداخل مربع الإحاطة المتوقع مع مربع الإحاطة الحقيقي. في مهام اكتشاف الأشياء، تُستخدم عتبات IoU بقيمة 0.5 و0.75 عادةً لتمثيل ظروف تقييم متوسطة وصارمة. ويلخص mAP أداء الاكتشاف عبر عتبات IoU متعددة. يوفر مقياس mAP@0.5:0.95 تقييماً أكثر قوة من خلال حساب متوسط الدقة عبر العتبات من 0.5 إلى 0.95 بزيادات قدرها 0.05، ولذلك فهو مقبول على نطاق واسع كمعيار قياسي لاكتشاف الأشياء.
تشير نتائج الكشف عبر مجموعات البيانات الثلاث إلى أن وحدة الكشف عن المكونات المقترحة تؤدي أداءً جيداً وثابتاً. تم عرض النتائج الكمية في Table 4. حققت مجموعة بيانات RICO أعلى أداء، بدقة بلغت 0.91، واستدعاء بنسبة 0.88، ودرجة F1 بلغت 0.89، وذلك بفضل مجموعتها الكبيرة والمتنوعة من توصيفات مكونات واجهة المستخدم. وأظهرت مجموعة ENRICO درجات أقل قليلاً بسبب بنيتها الأكثر تبسيطاً وقلة أنواع المكونات الموصفة. وسجلت مجموعة بيانات Guo أدنى درجة F1 (0.81)، ويرجع ذلك على الأرجح إلى التباين البصري الأكبر وقلة أنماط التخطيط الموحدة، مما يجعل عملية الكشف أكثر صعوبة. وبوجه عام، تؤكد هذه النتائج أن النموذج يحافظ على أداء قوي في الكشف عن المكونات عبر مختلف أنماط تصميم واجهة المستخدم وخصائص مجموعات البيانات.
| مجموعة البيانات | الدقة | الاستدعاء | مقياس F1 |
| RICO | 0.91 | 0.88 | 0.89 |
| ENRICO | 0.87 | 0.84 | 0.85 |
| Guo | 0.83 | 0.8 | 0.81 |
الجدول 4: أداء اكتشاف المكونات عبر مجموعات البيانات. يعرض الجدول الدقة (precision)، والاسترجاع (recall)، ودرجة F1 (F1-score) لاكتشاف مكونات واجهة المستخدم عبر مجموعات بيانات RICO وENRICO وGuo، مما يوضح فعالية نموذج الاكتشاف.
يوضح الشكل 3 أداء النموذج عبر مجموعات بيانات RICO وENRICO وGuo عند عتبات IoU بقيمة 0.5 و0.75. وكما هو متوقع، تكون قيم mAP أعلى عند IoU 0.5 بسبب متطلبات التداخل الأكثر تساهلاً. تسجل RICO باستمرار أعلى قيم mAP (0.89 عند IoU 0.5 و0.78 عند IoU 0.75)، مما يعكس ثراء وتماسك التعليقات التوضيحية الخاصة بها. وتُظهر ENRICO قيمًا أقل قليلاً، بينما تسجل Guo أدنى الدرجات بسبب التباين الأكبر في نمط التنسيق وكثافة المكونات. ويوضح الاتجاه التنازلي مع عتبات IoU الأكثر صرامة أن تعقيد مجموعة البيانات يؤثر بشكل مباشر على متانة الكشف.

الشكل 3. متوسط الدقة المتوسطة (mAP) عند عتبات التقاطع فوق الاتحاد (IoU) البالغة 0.5 و 0.75 عبر مجموعات البيانات. يقارن المخطط الخطي أداء اكتشاف المكونات عبر مجموعات بيانات RICO و ENRICO و Guo. يمثل المحور السيني مجموعات البيانات، بينما يوضح المحور الصادي قيم mAP. يتوافق المنحنيان مع عتبات IoU البالغة 0.5 و 0.75، مما يوضح تباين الأداء تحت مستويات مختلفة من صرامة الاكتشاف. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.
الشكل 4 يوضح mAP@IoU(0.5:0.95) لكل مجموعة بيانات، مما يوفر تقييماً أوسع لأداء الكشف عبر عشر عتبات IoU. وتكشف النتائج عن اتجاه تنازلي واضح من RICO (0.61) إلى ENRICO (0.57) ثم Guo (0.52)، وهو ما يؤكد أن نموذج الكشف المقترح يحقق أفضل تعميم على مجموعات البيانات الأكبر والأكثر هيكلية. ويسلط هذا المقياس المتوسط الأكثر صرامة الضوء على تدهور طفيف في الأداء قد لا يكون واضحاً تحت تقييم العتبة الواحدة. وتشير هذه النتائج إلى أنه على الرغم من الأداء القوي للنموذج عبر جميع مجموعات البيانات، إلا أن زيادة تنوع التخطيط وتغير المكونات يفرضان تحديات إضافية في ظل التقييم الصارم وفق نمط COCO. وتُعرض نتائج الكشف في الشكلين 3 و4، واللذين يوفران مقارنات كمية لـ mAP عبر مستويات IoU المختلفة.

الشكل 4. متوسط الدقة المتوسطة (mAP) المحتسب عبر عتبات التقاطع فوق الاتحاد (IoU) من 0.5 إلى 0.95 عبر مجموعات البيانات. يوضح الرسم البياني الخطي أداء اكتشاف المكونات عبر مجموعات بيانات RICO وENRICO وGuo باستخدام مقياس mAP المتوسط عبر عتبات IoU التي تتراوح من 0.5 إلى 0.95. يمثل المحور السيني مجموعات البيانات، ويشير المحور الصادي إلى قيم mAP المقابلة المسجلة على مقياس 0–1، مما يعكس أداء النموذج تحت عتبات اكتشاف متغيرة. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.
مقاييس جودة التخطيط
يتم تقييم جودة التخطيط باستخدام AE، ودقة التجميع (GA)، ودقة ترتيب القراءة (ROA)، والتي تعمل مجتمعة على تقييم الصحة الهيكلية، والتنظيم الإدراكي، وقابلية القراءة المعرفية لتخطيطات واجهة المستخدم المُنشأة.
خطأ في المحاذاة.
يشير AE (الانحراف القائم على البكسل) إلى مدى محاذاة عناصر واجهة المستخدم مع خطوط المحاذاة المثالية، مثل الأدلة اليسرى أو اليمنى أو العليا أو خطوط الأساس. ويشير انخفاض قيمة AE إلى أن العناصر مرتبة بشكل متسق مع حد أدنى من التشوه البصري، مما يحسن من القابلية للقراءة ووضوح التصميم العام. ويعد هذا المقياس مهمًا بشكل خاص لتقييم تحسين التنسيق المعرفي، حيث أن عدم المحاذاة يعيق التدفق البصري ويزيد من التعقيد المتصور. يوضح الشكل 5 قيم AE عبر مجموعات بيانات RICO وENRICO وGuo، حيث تم قياسها كمتوسط انحراف البكسل عن خطوط المحاذاة المثالية. وتظهر النتائج أن RICO تحقق أدنى قيمة AE (4.2 px)، مما يشير إلى أن مكونات واجهة المستخدم في مجموعة البيانات هذه تظهر أنماطًا هيكلية أكثر اتساقًا، مما يجعل عملية المحاذاة أسهل بالنسبة للنموذج. وتليها ENRICO بانحراف محاذاة متوسط قدره 6.1 px، مما يعكس مزيجًا من تخطيطات الشاشة جيدة الهيكلة والمتنوعة. أما مجموعة بيانات Guo فتسجل أعلى قيمة AE (7.4 px)، وذلك بسبب التنوع العالي في وضع المكونات وهياكل التنسيق غير القياسية، مما يشكل تحديًا للتحسين القائم على المحاذاة. وبشكل عام، تثبت هذه النتائج أن النموذج يحافظ على دقة محاذاة قوية عبر مجموعات البيانات المختلفة، على الرغم من زيادة تعقيد التنسيق.

الشكل 5. خطأ المحاذاة عبر مجموعات البيانات. يوضح الشكل خطأ المحاذاة عبر مجموعات البيانات؛ حيث تشير القيم الأقل إلى محاذاة أفضل. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.
دقة التجميع (GA).
تقيس دقة التجميع (GA) مدى فعالية النموذج في تجميع مكونات واجهة المستخدم ذات الصلة، على سبيل المثال، استناداً إلى مبادئ جشتالت مثل التقارب والتشابه والاستمرارية. وتشير دقة التجميع الأعلى إلى أن النموذج يحافظ على البنية المقصودة لعناصر واجهة المستخدم، مما يمكن المستخدمين من تفسير الواجهة بشكل أكثر طبيعية. ويعد هذا المقياس مفيداً بشكل خاص لتقييم ما إذا كانت وحدة تحسين التخطيط تنجح في تنظيم المحتوى إلى مجموعات بصرية ذات معنى. يعرض الشكل 6 توزيع GA التي حققها الإطار المقترح عبر مجموعات البيانات الثلاث. وتظهر مجموعة بيانات ENRICO أعلى وسيط لـ GA وأصغر مدى ربيعي، مما يشير إلى أداء تجميع مستقر ومتسق نظراً لتخطيطاتها المحددة جيداً والمصنفة وفق أنماط. بينما تظهر مجموعة بيانات RICO دقة تجميع متوسطة مع تباين أعلى، ويرجع ذلك على الأرجح إلى تنوعها الأكبر وتعقيد تخطيطاتها. وتسجل مجموعة بيانات Guo UI Color دقة تجميع أقل، حيث أن عيناتها غير متجانسة بصرياً وأقل تركيزاً على التخطيط الهيكلي. وبشكل عام، تشير النتائج إلى أن وحدة تحسين التخطيط المعرفي تعمل بشكل موثوق عبر مجموعات البيانات، محققة أفضل أداء تجميع في البيانات المتسقة هيكلياً.

الشكل 6. توزيع دقة التجميع عبر مجموعات البيانات. يوضح مخطط الصندوق دقة التجميع بناءً على مبادئ جشتالت عبر مجموعات بيانات RICO وENRICO وGuo’s UI Color. تمثل الصناديق المدى الربيعي، ويشير الخط المركزي إلى الوسيط، بينما تدل الشعيرات على نطاق القيم. يمثل المحور السيني مجموعات البيانات، ويظهر المحور الصادي درجات دقة التجميع. حجم العينة n=5128 من شاشات واجهة المستخدم (RICO: 4000، وENRICO: 1000، وGuo: 128). يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.
دقة ترتيب القراءة (ROA).
تقيس دقة ترتيب القراءة (ROA) مدى دقة النموذج في التنبؤ بتدفق القراءة الطبيعي لشاشة واجهة المستخدم، والذي يتبع عادةً نمطاً من الأعلى إلى الأسفل ومن اليسار إلى اليمين. ويعد الحفاظ على ترتيب القراءة الصحيح أمراً ضرورياً لسهولة الاستخدام، ووضوح التنقل، والاتساق مع اتفاقيات التصميم المعتمدة. وتشير دقة ترتيب القراءة الأعلى إلى أن النظام يحافظ على أنماط المسح المعرفي المتوقعة. يوضح الشكل 7 دقة ترتيب القراءة عبر مراحل تقييم مختلفة لمجموعات بيانات RICO وENRICO وGuo. تحقق ENRICO باستمرار أعلى دقة في ترتيب القراءة نظراً لبنية تخطيطها المنتظمة والموجهة نحو الأنماط، مما يتيح تنبؤاً أكثر دقة بتسلسلات القراءة الشبيهة بالبشر. وتظهر RICO أداءً متوسطاً مع تباين طفيف، مما يعكس تنوعها الأكبر وتعقيدها في العالم الحقيقي. أما مجموعة بيانات Guo فتظهر أقل دقة في ترتيب القراءة، حيث أن العديد من شاشاتها غنية بصرياً ولكنها تفتقر إلى تسلسلات هرمية واضحة للقراءة. وبشكل عام، تشير هذه النتائج إلى أن وحدة تحسين التخطيط المعرفي المقترحة تعمل بأكبر قدر من الموثوقية على مجموعات البيانات المهيكلة مع الحفاظ على تنبؤات مستقرة لترتيب القراءة عبر تصميمات واجهات المستخدم المتنوعة.

الشكل 7. دقة ترتيب القراءة عبر مراحل التقييم لعدة مجموعات بيانات. يوضح المخطط الخطي دقة ترتيب القراءة عبر خطوات التقييم لمجموعات بيانات RICO و ENRICO و Guo’s UI Color. يمثل المحور السيني مرحلة التقييم، ويشير المحور الصادي إلى دقة ترتيب القراءة. يمثل كل منحنى مجموعة بيانات، مما يوضح التغيرات في الحفاظ على التدفق البصري عبر مراحل التقييم المتتالية. وتُعد مرحلة التقييم تمثيلاً لمراحل الصقل التدريجية للإطار المقترح. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.
درجة اتساق التخطيط (LCS)
تقيس درجة اتساق التنسيق (LCS) مدى الحفاظ على اتساق تنسيقات واجهة المستخدم المولدة عبر شاشات متعددة داخل التطبيق نفسه. ويشمل ذلك الاتساق في المسافات، وقواعد المحاذاة، ومناطق الطباعة، وأنماط التجميع. وتشير الدرجة الأعلى إلى تحسن في التماسك عبر الشاشات، مما يؤدي إلى تجربة مستخدم (UX) أكثر توحيداً وبداهة. يوضح الشكل 8 درجة LCS المقاسة عبر مراحل تقييم متعددة لمجموعات بيانات RICO وENRICO وGuo’s UI Color. تحقق مجموعة بيانات ENRICO باستمرار أعلى قيم LCS نظراً لشاشات واجهة المستخدم الموحدة هيكلياً والمصنفة حسب الأنماط، مما يسهل تعلماً أكثر استقراراً للاتساق عبر الشاشات. وفي المقابل، تُظهر مجموعة بيانات RICO اتساقاً متوسطاً ولكنه يتحسن بثبات، وهو ما يعزى إلى قدرة النموذج على التعميم عبر تنسيقات واجهة مستخدم متنوعة للغاية. وكما كان متوقعاً، سجلت مجموعة بيانات Guo أدنى قيم LCS، كونها تركز بشكل أساسي على خصائص الألوان بدلاً من التنسيق الهيكلي، مما يجعل الاتساق عبر الشاشات أكثر تحدياً. وبشكل عام، تشير هذه النتائج إلى أن وحدة الاتساق عبر الشاشات المقترحة تعمل بأكبر قدر من الفعالية على مجموعات البيانات الموجهة نحو الأنماط، بينما لا تزال توفر تحسينات ملموسة عبر جميع مجموعات البيانات.

الشكل 8. درجة اتساق التنسيق عبر مراحل التقييم لمجموعات بيانات متعددة. يوضح المخطط الخطي درجات اتساق التنسيق عبر مرحلة التقييم لمجموعات بيانات RICO وENRICO وGuo’s UI Color. يمثل المحور السيني (x-axis) مرحلة التقييم، ويشير المحور الصادي (y-axis) إلى درجات اتساق التنسيق. يتوافق كل منحنى مع مجموعة بيانات، مما يوضح التحسن في التماسك الهيكلي للواجهات المولدة عبر مراحل التقييم المتتالية. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.
مقاييس جودة اللون
يتم تقييم سمات ألوان واجهة المستخدم (UI) المُنشأة باستخدام خمسة مقاييس قائمة على الإدراك مشتقة من CAM02-UCS: ΔE (فرق اللون الإدراكي)، والذي يحدد كمياً التجانس الإدراكي بين ألوان اللوحة؛ ونسبة التباين (بناءً على WCAG 2.1)، والتي تقيم إمكانية القراءة بين عناصر المقدمة والخلفية؛ ومؤشر التناغم اللوني (CHI)، الذي يقيس التوافق الجمالي بين تدرجات الألوان؛ ودرجة تنوع الألوان (CDS)، التي تعكس التباين داخل مساحة اللون الإدراكية؛ ودرجة بروز اللون (CPS)، التي تقيم التوازن وهيمنة الألوان داخل اللوحة. وتوفر هذه المقاييس مجتمعة تقييماً شاملاً لكل من الجودة الجمالية وأداء الألوان الموجه نحو سهولة الاستخدام. وتظهر النتائج أن الطريقة المقترحة تحقق قيمة ΔE أقل تبلغ 4.12، مما يشير إلى تحسن في التجانس الإدراكي عبر الألوان. كما تؤكد نسبة التباين البالغة 6.21 الامتثال لمعايير إمكانية الوصول، مما يضمن تعزيز إمكانية القراءة. ويقدم الجدول 5 مقارنة كمية بين وحدة نمذجة الألوان المقترحة والطرق المرجعية. حيث يرتفع مؤشر CHI من 0.61 إلى 0.83، مما يشير إلى تحسن التماسك الجمالي في الانتقالات اللونية. بالإضافة إلى ذلك، تزداد درجة CDS بنسبة تزيد عن 50%، مما يثبت أن اللوحات المُنشأة تحافظ على تباين أغنى دون إحداث فوضى بصرية. وتشير قيم CPS الأعلى إلى توزيع متوازن للألوان السائدة، مما يمنع التشبع المفرط لأي لون بمفرده. وبشكل عام، تؤكد هذه النتائج فعالية وحدة نمذجة الألوان القائمة على CAM02-UCS في إنشاء مخططات ألوان لواجهة المستخدم تكون متناغمة، وقابلة للقراءة، ومُحسنة إدراكياً.
| المقياس | التعريف | الطريقة المقترحة | الخط المرجعي1 | التحسن (%) |
| ΔE (CAM02-UCS) | الاختلاف اللوني الإدراكي | 4.12 | 7.85 | أقل بنسبة 47.5% |
| نسبة التباين (WCAG) | قابلية قراءة أزواج المقدمة والخلفية (FG–BG) | 6.21 | 4.38 | 41.80% |
| CHI (مؤشر التناغم اللوني) | تناغم صبغة اللون والكرومـا | 0.83 | 0.61 | 36.10% |
| CDS (درجة التنوع اللوني) | التباين في فضاء J′a′b′ | 18.70 | 12.40 | 50.80% |
| CPS (درجة البروز اللوني) | استقرار الألوان السائدة | 0.72 | 0.55 | 30.90% |
الجدول 5: مقارنة كمية لمقاييس جودة الألوان بين الطريقة المقترحة والطرق المرجعية. يعرض الجدول مقاييس تقييم جودة الألوان، بما في ذلك فرق اللون الإدراكي (ΔE في CAM02-UCS)، ونسبة التباين (WCAG)، ومؤشر تناغم الألوان (CHI)، ودرجة تنوع الألوان (CDS)، ودرجة بروز الألوان (CPS). وتتم مقارنة نتائج الطريقة المقترحة بالقيم المرجعية، إلى جانب نسب التحسن.
الخصائص الديموغرافية للمشاركين وتصميم الدراسة
شارك ما مجموعه 30 مشاركاً في عملية التقييم، تراوحت أعمارهم بين 20 و35 عاماً (متوسط العمر: 26.4 ± 3.2 سنة). شملت المجموعة أفراداً من خلفيات متنوعة، بما في ذلك مهندسو برمجيات، وطلاب، ومصممو واجهة المستخدم وتجربة المستخدم (UI/UX). وبناءً على الكفاءة الذاتية في استخدام الحاسوب، صُنّف 40% من المشاركين كمستخدمين متوسطين، و35% كمستخدمين متقدمين، و25% كمبتدئين. وكان لدى نصف المشاركين تقريباً خبرة سابقة في تصميم واجهة المستخدم وتجربة المستخدم (UI/UX) أو المجالات ذات الصلة، بينما لم يمتلك بقية المشاركين هذه الخبرة. وقد ضمن هذا التنوع إجراء تقييم متوازن عبر مختلف مستويات الخبرة التقنية والإلمام بالتصميم.
مقاييس دراسة المستخدم
أُجري تقييم متمحور حول المستخدم باستخدام مقاييس متعددة، شملت مؤشر NASA-TLX، ومقياس سهولة استخدام النظام (SUS)، ودرجة التناغم الجمالي (AHS)، ووقت كفاءة البحث (SET)، وتقييم اتساق الشاشات المتقاطعة (CSCR)، وذلك لتقييم الحمل المعرفي، وسهولة الاستخدام، والجاذبية البصرية، والكفاءة، والاتساق.
يقوم مقياس NASA-TLX بتكميم العبء الذهني من خلال قياس عوامل مثل الطلب الذهني، والجهد، والإحباط. وتشير الدرجات المنخفضة إلى انخفاض الحمل المعرفي وتحسن سهولة التفاعل. وقد أدى الإطار المقترح باستمرار إلى الحصول على درجات NASA-TLX أقل عبر جميع مجموعات البيانات، مما يشير إلى انخفاض الجهد الذهني. ويمكن إرجاع هذا التحسن إلى دمج مبادئ التصميم المعرفي، بما في ذلك تجميع Gestalt، والتباعد الأمثل، والتسلسل الهرمي البصري المحسن، والتي تسهل مجتمعة تنقلاً أكثر بديهية. ويوفر مقياس SUS درجة سهولة استخدام معيارية تتراوح من 0 إلى 100، حيث تشير القيم الأعلى إلى تحسن في سهولة الاستخدام والوضوح. وقد حقق الإطار المقترح درجات SUS أعلى مقارنة بالطرق المرجعية، مما يعكس تحسينات في كل من التخطيط الهيكلي ووضوح الألوان. وقد ساهم تحسين المحاذاة والتباعد وتدفق التنقل في واجهات اعتبرها المستخدمون أكثر بديهية وتماسكاً من الناحية الوظيفية. أما مقياس AHS، الذي يتم قياسه على مقياس ليكرت المكون من 7 نقاط، فيقيم الجاذبية البصرية المتصورة والتناغم اللوني. وقد حققت الواجهات التي تم إنشاؤها باستخدام وحدة نمذجة الألوان القائمة على CAM02-UCS قيم AHS أعلى، مما يشير إلى انتقالات لونية أكثر سلاسة ولوحات ألوان أكثر توازناً بصرياً. وقد فضل المشاركون باستمرار هذه الواجهات بسبب تحسن التباين، وتماسك التدرج اللوني، وتقليل الفوضى البصرية، مما يسلط الضوء على أهمية نمذجة الألوان الإدراكية في تصميم واجهات المستخدم. ويقيس SET الوقت الذي يستغرقه المستخدمون لتحديد عناصر واجهة المستخدم المستهدفة أثناء مهام البحث البصري. وتشير قيم SET المنخفضة إلى تحسن في التنظيم والتسلسل الهرمي البصري. وقد خفض الإطار المقترح قيمة SET بشكل كبير عبر جميع مجموعات البيانات، مما يثبت أن دمج تجميع Gestalt، والتباعد الموجه بالانتباه، وهياكل التخطيط المنقحة يتيح تفاعلاً أسرع وأكثر كفاءة. ويقيم مقياس CSCR مدى اتساق تصميم واجهة المستخدم عبر شاشات متعددة. وتشير الدرجات الأعلى إلى استمرارية أفضل في التخطيط واللون والتنظيم الهيكلي. وقد حقق الإطار المقترح قيم CSCR أعلى، مما يعكس فعالية وحدة الاتساق متعدد الشاشات في الحفاظ على مخططات ألوان وتباعد وهياكل هرمية مستقرة عبر الواجهات.
الشكل 9 يوضح نتائج دراسة المستخدم المقارنة لجميع المقاييس (NASA-TLX، وSUS، وAHS، وSET، وCSCR) عبر مجموعات بيانات RICO، وENRICO، وGuo. وبشكل عام، لوحظت تحسينات متسقة عبر جميع مقاييس التقييم. ومن الجدير بالذكر أن مجموعة بيانات Guo أظهرت أداءً فائقاً في المقاييس التي تركز على المستخدم، بما في ذلك انخفاض الحمل المعرفي (NASA-TLX)، وارتفاع مستوى القابلية للاستخدام (SUS)، وتحسن التناغم الجمالي (AHS)، وتقليل وقت كفاءة البحث (SET)، وتحسن الاتساق عبر الشاشات (CSCR). ومع ذلك، تتطلب هذه النتائج تفسيراً دقيقاً؛ حيث تعزى تحسينات مقاييس تجربة المستخدم (UX) الملحوظة في مجموعة بيانات Guo بشكل أساسي إلى اتساق ألوانها القوي وتكوينها البصري الأبسط نسبياً، وليس إلى جودة التخطيط الهيكلي الفائقة. وبينما يرى المستخدمون أن هذه الواجهات أكثر تناغماً بصرياً وأقل تطلباً من الناحية المعرفية، إلا أن النتائج السابقة أثبتت أن مجموعة بيانات Guo تقدم أداءً ضعيفاً من حيث المحاذاة، والتجميع، وترتيب القراءة. وهذا يسلط الضوء على تمييز مهم بين العوامل الإدراكية والهيكلية في تصميم واجهة المستخدم (UI). فبينما تعزز السمات الإدراكية، مثل التناغم اللوني، تجربة المستخدم بشكل كبير، يظل الدقة الهيكلية واتساق التخطيط أمرين بالغَي الأهمية للقابلية للاستخدام الوظيفية. وبناءً على ذلك، يتطلب التصميم الأمثل لواجهة المستخدم توازناً بين التناغم الإدراكي والصحة الهيكلية.

الشكل 9. مقارنة مقاييس دراسة المستخدم عبر مجموعات البيانات. يقارن المخطط البياني الشريطي المجمع مقاييس دراسة المستخدم عبر مجموعات بيانات RICO و ENRICO و Guo’s UI Color. يمثل المحور السيني مقاييس التقييم، بما في ذلك مؤشر حمل مهام وكالة ناسا (NASA-TLX)، ومقياس سهولة استخدام النظام (SUS)، ودرجة التناغم الجمالي (AHS)، وزمن الكفاءة الهيكلية (SET)، ومعدل الاتساق عبر الشاشات (CSCR)، بينما يشير المحور الصادي إلى الدرجات المقابلة. تمثل الأشرطة الأداء لكل مجموعة بيانات، مما يوضح الاختلافات في سهولة الاستخدام، والحمل المعرفي، والجودة الجمالية، واتساق الواجهة. NASA-TLX (0–100، القيمة الأقل هي الأفضل)، SUS (0–100، القيمة الأعلى هي الأفضل)، AHS (مقياس ليكرت 1–7)، SET (s، القيمة الأقل هي الأفضل)، و CSCR (0–1، القيمة الأعلى هي الأفضل). يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.
التحقق الإحصائي من الفرضيات
لمزيد من التحقق من صحة الفرضيات المقترحة (H1–H4)، أُجري اختبار الدلالة الإحصائية لمقاييس التقييم الرئيسية، بما في ذلك جودة التخطيط، والحمل المعرفي، والتناغم اللوني، ومقاييس القابلية للاستخدام (الجدول 6). تم عرض النتائج في صورة المتوسط ± الانحراف المعياري، وقُيمت الدلالة الإحصائية باستخدام اختبارات t المقترنة بفاصل ثقة 95% (p < 0.05). وتشير النتائج إلى أن الإطار المقترح يحقق تحسينات ذات دلالة إحصائية مقارنة بالمنهجيات المرجعية عبر مقاييس متعددة، بما في ذلك دقة المحاذاة، ودقة التجميع، وترتيب القراءة، والحمل المعرفي (NASA-TLX)، ومقاييس التناغم اللوني. ومن الملاحظ أن الانخفاض في الحمل المعرفي والتحسينات في مقاييس القابلية للاستخدام أظهرت فروقاً ذات دلالة عالية (p < 0.01). وتؤكد هذه النتائج أن دمج مبادئ التصميم المعرفي ونمذجة الألوان الإدراكية يؤدي إلى تحسينات ملموسة وذات دلالة إحصائية في جودة واجهة المستخدم (UI)، مما يدعم الفرضيات H1–H4.
| مقياس | القيمة المرجعية (المتوسط ± الانحراف المعياري) | المقترح (المتوسط ± الانحراف المعياري) | نسبة التحسن (%) | القيمة الاحتمالية (p-value) | الأهمية |
| خطأ في المحاذاة (↓) | 7.8 ± 1.2 | 4.2 ± 0.9 | 46.10% | 0.003 | جوهري |
| دقة التجميع (↑) | 0.68 ± 0.05 | 0.82 ± 0.04 | 20.50% | 0.001 | جوهري |
| دقة ترتيب القراءة (↑) | 0.72 ± 0.06 | 0.87 ± 0.03 | 20.80% | 0.002 | جوهري |
| مقياس ناسا للحمل الذهني (NASA-TLX) (↓) | 68.5 ± 5.4 | 47.2 ± 4.8 | 31.10% | 0.0005 | ذو دلالة إحصائية عالية |
| درجة مقياس سهولة الاستخدام (↑) | 71.3 ± 6.2 | 88.9 ± 4.5 | 24.70% | 0.0008 | ذو دلالة إحصائية عالية |
| مؤشر التناغم اللوني (↑) | 0.61 ± 0.07 | 0.83 ± 0.05 | 36.00% | 0.001 | جوهري |
| نسبة التباين (↑) | 4.1 ± 0.6 | 6.2 ± 0.5 | 51.20% | 0.002 | جوهري |
الجدول 6: مقارنة إحصائية لمقاييس الأداء بين الطرق المرجعية والطرق المقترحة. يعرض الجدول المتوسط والانحراف المعياري (mean ± SD) لمقاييس الأداء الرئيسية، بما في ذلك خطأ المحاذاة، ودقة التجميع، ودقة ترتيب القراءة، ومؤشر ناسا لعبء المهام (NASA-TLX)، ومقياس سهولة استخدام النظام (SUS)، ومؤشر التناغم اللوني، ونسبة التباين. كما تم تسجيل نسب التحسن، وقيم p، ومستويات الدلالة الإحصائية. يشير الرمز (↑) إلى أن القيم الأعلى أفضل، والرمز (↓) يشير إلى أن القيم الأدنى أفضل. تم تقييم الدلالة الإحصائية عند p < 0.05.
ملاحظات خاصة بمجموعة البيانات
يمكن إرجاع الأداء المنخفض نسبيًا الملحوظ في المقاييس الهيكلية في مجموعة بيانات Guo إلى خصائصها المتأصلة. فمجموعة بيانات Guo أصغر من RICO و ENRICO وتركز بشكل أساسي على ميزات الألوان الإدراكية بدلاً من تعليقات التخطيط الهيكلية. ونتيجة لذلك، تظهر المجموعة تباينًا أكبر في وضع المكونات، وتنظيمًا هرميًا أضعف، وهياكل تخطيط أقل اتساقًا عبر الشاشات. تجعل هذه الخصائص من تعلم الهياكل وتحسين التخطيط أمرًا أكثر صعوبة، مما يفسر انخفاض الأداء في مقاييس المحاذاة، والتجميع، وترتيب القراءة، على الرغم من الأداء القوي في التقييمات الإدراكية والمتمركزة حول المستخدم.
دراسة الاستئصال
تقيم دراسة الاستئصال مساهمة كل وحدة ضمن الإطار المقترح من خلال إزالة المكونات الفردية بشكل منهجي وتحليل تأثيرها على جودة التخطيط، ونمذجة الألوان، وأداء الكشف. يتم تقييم جودة التخطيط باستخدام AE وGA وROA وLCS. حيث يعكس AE الانحراف الموضعي لعناصر واجهة المستخدم، وتشير القيم الأعلى إلى ضعف البنية المكانية. ويقيم GA مدى فاعلية تنظيم المكونات وفقاً لمبادئ Gestalt. بينما يقيس ROA الحفاظ على التدفق البصري المنطقي، في حين يحدد LCS كمياً الاتساق الهيكلي عبر الشاشات من حيث المحاذاة والتباعد وتنظيم التخطيط. كما يتم تقييم تدهور جودة الألوان باستخدام ΔE (فرق اللون الإدراكي)، وCHI، وCDS، والتي تقيم مجتمعةً التوحيد الإدراكي، والتماسك الجمالي، وثراء لوحة الألوان. ويتم تقييم أداء الكشف باستخدام mAP والدقة (precision) والاسترجاع (recall)، والتي تحدد كمياً تأثير استبدال وحدة Faster R-CNN بنموذج كشف أبسط. وتوفر هذه المقاييس معاً تقييماً شاملاً لكيفية مساهمة كل وحدة في الأداء العام للنظام.
الجدول 7 يلخص مساهمة كل وحدة ويقارن الإطار المقترح مع نهج توليد واجهة المستخدم (UI) الحالية. يحقق النموذج الكامل أفضل أداء في جميع مقاييس جودة المخطط، ونمذجة الألوان، والكشف، مما يثبت أن التصميم المعرفي، ونمذجة الألوان الإدراكية، والفهم البصري العميق لها تأثير تآزري. عند إزالة وحدة نمذجة الألوان، تزداد قيمة ΔE بشكل ملحوظ، بينما تنخفض قيم CHI وCDS بشكل كبير، مما يشير إلى فقدان الانتظام الإدراكي والتناغم اللوني. وهذا يؤكد أهمية النمذجة القائمة على CAM02-UCS في الحفاظ على الجودة الجمالية والإدراكية. تؤدي إزالة وحدة المخطط المعرفي إلى زيادة كبيرة في AE وانخفاض ملحوظ في GA وROA، مما يثبت أن مبادئ التصميم المعرفي ضرورية لإنتاج مخططات متماسكة هيكلياً وقابلة للقراءة. وتؤدي إزالة وحدة اتساق الشاشات المتعددة إلى انخفاض في LCS، مما يؤكد دورها في الحفاظ على أنماط مخططات متسقة عبر شاشات متعددة. كما يؤدي استبدال كاشف Faster R-CNN بشبكة CNN أبسط إلى انخفاض حاد في mAP والدقة والاستدعاء، مما يسلط الضوء على الأهمية البالغة للكشف القوي عن المكونات في المسار العام للعملية. وبالمقارنة مع الطرق المرجعية، بما في ذلك pix2code وREDRAW وLDGM، يتفوق الإطار المقترح باستمرار على جميع النهج من حيث دقة المخطط، والتماسك البصري، وجودة الألوان الإدراكية.
| الطريقة / الوحدة | AE ↓ | GA ↑ | ROA ↑ | LCS ↑ | ΔE ↓ | CHI ↑ | CDS ↑ | mAP ↑ |
| إزالة وحدة اللون | 0.14 | 0.86 | 0.92 | 0.84 | 7.85 | 0.61 | 12.4 | 0.9 |
| إزالة وحدة التخطيط المعرفي | 0.18 | 0.72 | 0.73 | 0.69 | 4.21 | 0.79 | 17.9 | 0.89 |
| إزالة اتساق الشاشات المتعددة | 0.17 | 0.81 | 0.88 | 0.62 | 4.18 | 0.81 | 17.3 | 0.9 |
| استبدال Faster R-CNN بـ Simple CNN | 0.16 | 0.85 | 0.91 | 0.85 | 4.15 | 0.82 | 18.1 | 0.74 |
| Pix2Code | 0.25 | 0.61 | 0.65 | 0.51 | 10.2 | 0.48 | 9.6 | 0.65 |
| REDRAW | 0.21 | 0.66 | 0.72 | 0.56 | 8.7 | 0.52 | 11.4 | 0.72 |
| LDGM (Layout Diffusion) | 0.19 | 0.74 | 0.79 | 0.63 | 6.9 | 0.59 | 13.8 | 0.8 |
| النموذج الكامل المقترح | 0.12 | 0.89 | 0.94 | 0.87 | 4.12 | 0.83 | 18.7 | 0.91 |
الجدول 7: دراسة الاستئصال وتحليل الأداء المقارن للإطار المقترح والطرق المرجعية. يقيم الجدول تأثير المكونات الفردية من خلال مقارنة النموذج المقترح الكامل مع متغيرات تم فيها إزالة وحدات محددة (وحدة اللون، وحدة التخطيط المعرفي، اتساق الشاشات المتعددة، واستبدال Faster R-CNN بشبكة CNN بسيطة)، بالإضافة إلى الطرق المرجعية (pix2code و REDRAW و LDGM). يتم تقييم الأداء باستخدام خطأ المحاذاة (AE)، ودقة التجميع (GA)، ودقة ترتيب القراءة (ROA)، ودرجة اتساق التخطيط (LCS)، وفرق اللون الإدراكي (ΔE)، ومؤشر تناغم الألوان (CHI)، ودرجة تنوع الألوان (CDS)، ومتوسط الدقة المتوسطة (mAP). يشير الرمز (↑) إلى أن القيم الأعلى هي الأفضل، ويشير الرمز (↓) إلى أن القيم الأدنى هي الأفضل.
توافر البيانات:
مجموعات البيانات المستخدمة في هذه الدراسة متاحة عبر الروابط التالية: مجموعة بيانات RICO: https://interactionmining.org/rico؛ مجموعة بيانات ENRICO: https://github.com/luileito/enrico؛ مجموعة بيانات Guo لألوان واجهة المستخدم (Guo’s UI Color Dataset): https://github.com/guozhongke/UI-Color-Dataset.
الملف التكميلي 1. الصيغ الرياضية وتفاصيل التنفيذ الموسعة.يوفر هذا الملف الصيغ الرياضية التفصيلية وسير العمل الخوارزمي الذي يدعم إطار عمل النمذجة الأولية الآلية لواجهات المستخدم المقترح. ويتضمن تدريب الكشف عن المكونات، واستخراج أنماط التخطيط، ونمذجة التناغم اللوني، والهدف الموحد للنمذجة الأولية لواجهة المستخدم، وتفاصيل الكشف باستخدام Faster R-CNN، وحسابات المسافة المكانية وتشابه المحاذاة، وبناء شجرة واجهة المستخدم المنطقية، ونمذجة الألوان الإدراكية القائمة على CAM02-UCS، وتحسين التصميم المعرفي، ونمذجة الاتساق متعدد الشاشات، والخوارزميات S1–S3.يرجى النقر هنا لتنزيل هذا الملف.