Record comparative local model evaluation

This commit is contained in:
Hamza Ayed
2026-10-03 18:05:09 +03:00
parent 1f8014f226
commit 15a228514a
3 changed files with 127 additions and 3 deletions
+1 -1
View File
@@ -149,7 +149,7 @@
## المرحلة 7 — تقييم النماذج والتدريب
- [x] إنشاء مجموعة أولية من خمسة أسئلة عربية/برمجية مع معايير مراجعة بشرية وفحوص شكل/قيمة محدودة، ومشغّل يسجل الأجوبة ووقت كل طلب واسم أداة الوكيل في JSON. تجربة واحدة على Gemma 4 E2B وQwen 2.5 1.5B وحُفظت النتائج في `evals/results/` (2026-10-02).
- تكرار التقييم مع إجابات مرجعية ومراجعين/درجات بشرية، وقياس استهلاك الذاكرة واعتماد مقارنة قابلة للتكرار. (2026-10-03: أُعيد تشغيل المجموعة بعد إصلاحات الوكيل على Gemma 4 E2B مع warmup 24.5 ثانية؛ 5/5 طلبات بلا أخطاء، الفحوص التلقائية 4/4، ومتوسط زمن الرد 14.61 ثانية، الوسيط 12.91، والمدى 0.03–25.93 ثانية. تقرير `evals/results/gemma4_e2b_2026-10-03_175827.json`. الإجابات محفوظة للمراجعة، لكن التقييم البشري فارغ. قراءة عملية Ollama وحدها أعطت 120.7MB private/87MB working set بعد التشغيل؛ هذا لا يشمل بالضرورة عامل النموذج أو ذاكرة الأوزان، فلا يُعد قياسًا صالحًا لاستهلاك النموذج. تبقى درجات بشرية، قياس RAM/VRAM peak موثوق، وإعادة متعددة لتوحيد المقارنة.) الجولة الدافئة السابقة كانت Gemma 8/10 بمتوسط 16.32 ثانية وQwen 5/10 بمتوسط 8.93 ثانية. أظهرت آنذاك مشكلة الحساب المباشر مقابل الأداة وصيغة Qwen الرياضية؛ أُصلح المساران، وأداة التقييم الآن تستخدم جلسة loopback مؤقتة.
- تكرار التقييم مع إجابات مرجعية ومراجعين/درجات بشرية، وقياس استهلاك الذاكرة واعتماد مقارنة قابلة للتكرار. (2026-10-03: أُعيد تشغيل المجموعة بعد إصلاحات الوكيل على Gemma 4 E2B وQwen 2.5 1.5B مع warmup؛ كلاهما 5/5 طلبات بلا أخطاء و4/4 فحوص تلقائية ضيقة. Gemma متوسط 14.61 ثانية (وسيط 12.91؛ 0.03–25.93)، وQwen متوسط 7.00 (وسيط 5.80؛ 0.03–18.48). تقريران `evals/results/gemma4_e2b_2026-10-03_175827.json` و`evals/results/qwen2.5_1.5b-instruct-q4_K_M_2026-10-03_180307.json`. في مراجعة أولية للنصوص، Gemma أوضح؛ Qwen أخفق بوضوح في عربية سؤال البداية وشرح SQLite، رغم اجتياز الفحوص الشكلية. لم تُسجل درجات بشرية بعد. قياس عملية Ollama المفردة (120.7MB private/87MB working عقب Gemma، ثم 109.3/74.2MB بعد تبديل النموذج) لا يشمل بالضرورة عامل النموذج أو ذاكرة الأوزان، فلا يُعد peak RAM صالحًا. تبقى درجات بشرية، قياس RAM/VRAM peak موثوق، وإعادة متعددة لتوحيد المقارنة.) الجولة السابقة كانت Gemma 8/10 بمتوسط 16.32 ثانية وQwen 5/10 بمتوسط 8.93 ثانية. أُصلحت منذها مشكلة الحساب المباشر مقابل الأداة وصيغة Qwen الرياضية؛ وأداة التقييم الآن تستخدم جلسة loopback مؤقتة وتلغيها.
- اختيار النماذج حسب الرخصة، الجودة، اللغة، دعم الأدوات، كمية VRAM، وإمكانية التشغيل التجاري. لا نعتمد وصف «مفتوح» وحده كإثبات سماح تجاري؛ نراجع الرخصة الرسمية لكل إصدار.
- تحسين أولي عبر prompts وRAG والأدوات؛ هذه غالبًا تعالج نقص المعرفة أو القدرة على الفعل دون تغيير أوزان النموذج.
- عند توفر GPU مناسب: تجربة LoRA/QLoRA على بيانات مرخصة ومنقحة، ومقارنة النتائج بالمجموعة المرجعية قبل اعتماد adapter.