{ "created_at_utc": "2026-10-02T14:00:13.073708+00:00", "base_url": "http://127.0.0.1:8000", "dataset": "evals\\knowledge_retrieval.jsonl", "metrics": { "cases": 3, "hit_at_1": 1.0, "hit_at_3": 1.0, "mean_reciprocal_rank": 1.0, "evidence_rate": 1.0 }, "results": [ { "id": "conversation-storage-ar", "query": "أين تحفظ المحادثات؟", "expected_document": "storage.md", "expected_evidence": "SQLite", "rank": 1, "top_paths": [ "storage.md" ], "evidence_found": true }, { "id": "image-model-ar", "query": "ما النموذج الذي يعالج الصور تلقائيًا؟", "expected_document": "images.md", "expected_evidence": "Ministral 3:3b", "rank": 1, "top_paths": [ "images.md" ], "evidence_found": true }, { "id": "preview-safety-ar", "query": "كيف نحمي معاينة الملف قبل الموافقة؟", "expected_document": "preview.md", "expected_evidence": "SHA256", "rank": 1, "top_paths": [ "preview.md" ], "evidence_found": true } ], "note": "Small deterministic fixture set; measures lexical retrieval only, not answer quality or general RAG quality." }