লোড হচ্ছে…
লোড হচ্ছে…
BENCHMARK RESULTS
৬টি মডেল, ৫টি তথ্য-সংগ্রহ আর্কিটেকচার, ৯০০টি কোয়েরি — সব সংখ্যা গবেষণাপত্র থেকে, কোনো তথ্য তৈরি নয়।
৫টি জিরো-শট বেসলাইন + ১টি ফাইন-টিউনড মডেল।
ফাইন-টিউনড KrishokChat-4B — সেরা জিরো-শটের চেয়ে ১.৯× বেশি GenF1 (০.৩১৪ vs ০.১৬৫ / ০.৩০০ vs ০.২৫৩)।
| মডেল | GenF1 | GenHal% | TrtCor% | TrtHal% |
|---|---|---|---|---|
Gemini-2.5-FL | 0.104 | 37.15 | 43.64 | 15.90 |
Gemma-4-26B | 0.087 | 32.12 | 38.73 | 9.83 |
LLaMA-3.1-8B | 0.165 | 10.06 | 12.43 | 1.73 |
Qwen-2.5-7B | 0.136 | 11.17 | 13.29 | 2.02 |
GPT-OSS-120B | 0.113 | 36.20 | 32.92 | 9.47 |
KrishokChat-4B (SFT)★ সেরা ফলাফল | 0.314 | 19.83 | 35.55 | 8.96 |
ডানে টানুন →
KrishokChat-4B ফাইন-টিউনড — GenF1 তীব্রভাবে উন্নত (০.৩১৪ vs সেরা জিরো-শট ০.১৬৫)।
৫টি আর্কিটেকচার, BN→BN। হাইব্রিড RRF সর্বোচ্চ, BM25 সেরা একক।
| আর্কিটেকচার | R@1 | R@5 | R@10 | MRR |
|---|---|---|---|---|
Hybrid RRF (Gemini+BM25)★ সেরা ফলাফল | 0.291 | 0.466 | 0.539 | 0.551 |
BM25 (Sparse) | 0.205 | 0.405 | 0.506 | 0.481 |
Dense (Gemini-001) | 0.320 | 0.431 | 0.464 | 0.514 |
Dense (BGE-M3 Native) | 0.281 | 0.369 | 0.408 | 0.432 |
ColBERT (BGE-M3) | 0.255 | 0.414 | 0.487 | 0.324 |
ডানে টানুন →
Dense তথ্য-সংগ্রহ ফার্মার ভাষায় প্রায় ব্যর্থ (০.০৯৩), কিন্তু আনুষ্ঠানিক নিরাপত্তা কোয়েরিতে প্রায় নিখুঁত (০.৯৭০)।
৯৬.৪% কোয়েরির জ্যাকার্ড < ০.১০ — ফার্মার ভাষা আনুষ্ঠানিক ভাষার চেয়ে আলাদা।
BM25 স্ক্রিপ্ট সীমা পার হলে প্রায় ব্যর্থ (০.৫০৬ → ০.০০৪), Dense টিকে থাকে (০.৪৬৪ → ০.৪২৫)।
| সেটিং | Dense | BM25 | বিজয়ী |
|---|---|---|---|
| BN→BN | 0.464 | 0.506 | BM25 |
| EN→BN (cross-lingual) | 0.425 | 0.004 | Dense |
| EN→EN | 0.442 | 0.384 | Dense |
BM25: ৯৯% ড্রপ | Dense: মাত্র ৮% ড্রপ — আর্কিটেকচার পছন্দ ভাষা পরিস্থিতি থেকে আলাদা নয়।
৩৫০টি প্রকৃত ফার্মার কোয়েরি — ৩০০টি মাঠ সাক্ষাৎকার থেকে।
| মডেল | Token F1 | Halluc % |
|---|---|---|
| Gemini-2.5-FL | 0.2196 | 38.29 |
| Gemma-4-26B | 0.1375 | 23.14 |
| KrishokChat-4B (SFT) | 0.1170 | 41.14 |
| Qwen-2.5-7B | 0.0841 | 14.29 |
| LLaMA-3.1-8B | 0.0078 | 1.71 |
| GPT-OSS-120B | 0.0002 | 14.57 |
একই বেঞ্চমার্ক প্রশ্নে জিরো-শট বনাম ফাইন-টিউনড বনাম মাল্টি-এজেন্ট গ্রাউন্ডেড মডেলের পাশাপাশি ফলাফল, রাসায়নিক নিরাপত্তা স্কোর এবং কেন স্টেজ ৪ ভেরিফায়ার গেট আবশ্যক তার ইন্টারঅ্যাক্টিভ বিশ্লেষণ।
১,০০০টি প্রকৃত ফার্মার প্রশ্ন থেকে ৪৬টি নির্বাচিত, ৩ ধাপে মানব-পর্যালোচিত ক্যাটাগরি। প্রশ্নগুলো এই সিস্টেমের প্রকৃত পাইপলাইন দিয়ে চালানো হয়; সব সংখ্যা অফলাইনে প্রি-কম্পিউটেড।
| ক্যাটাগরি | n | অস্বীকৃত (রেফারাল) | ভেরিফায়ার উত্তীর্ণ |
|---|---|---|---|
| ডোজ | 10 | 1 | 7/10 |
| সময় | 10 | 0 | 9/10 |
| রোগ / পোকা | 10 | 0 | 7/10 |
| সাধারণ | 2 | 0 | 2/2 |
| অপ্রাসঙ্গিক | 2 | 2 | 0/2 |
| উত্তরযোগ্য নয় | 12 | 12 | 0/12 |
যান্ত্রিক পাইপলাইন আচরণ — মানব স্কোরই চূড়ান্ত বিচার। ক্যাটাগরি ট্রেনিং/রপ্তানি/যোগাযোগ-ধরনের প্রশ্ন মানে "উত্তরযোগ্য নয়"।
কর্পাস-কভারেজ গেট (D1a) সক্রিয়: প্রশিক্ষণ, রপ্তানি, ভেন্ডর/চারা প্রাপ্যতা, প্রতিষ্ঠানগত ও সরকারি-সহায়তা সংক্রান্ত প্রশ্নে সরাসরি ১৬১২৩ রেফারাল — কোনো জল্পনা-কল্পনা নয়। অফ-টপিক ২/২-ও প্রত্যাখ্যাত। লক্ষ্য পূরণ হয়েছে (≥৯০%)।
প্রতিটি উত্তর correct / partial / unsupported / refused স্কেলে মূল্যায়িত হয়। স্কোর শেষ হলে এখানে κ (ইন্টার-রেটার এগ্রিমেন্ট), ক্যাটাগরি-ভিত্তিক ফলাফল এবং অস্বীকৃতির নিশ্চিত হার স্বয়ংক্রিয়ভাবে প্রকাশ পাবে।