मनोरंजन

सर्वम एआई ने लॉन्च किया विजन 2.1, जटिल दस्तावेजों और भारतीय भाषाओं की हैंडराइटिंग को समझने में सक्षम

नई दिल्ली। आर्टिफिशियल इंटेलिजेंस के क्षेत्र में सर्वम एआई ने अपना नया विजन-लैंग्वेज मॉडल सर्वम विजन 2.1 लॉन्च किया है। कंपनी के मुताबिक, नया मॉडल पुराने और जटिल दस्तावेजों, अनियमित स्कैन, टेबल, फॉर्म और हस्तलिखित सामग्री को समझकर उसमें मौजूद जानकारी को स्ट्रक्चर्ड डेटा में बदल सकता है। इस डेटा का इस्तेमाल बिजनेस अपने प्रोडक्शन वर्कफ्लो में सीधे कर सकते हैं।

कंपनी ने बताया कि विजन 2.1 को पिछले मॉडल की सीमाओं को ध्यान में रखते हुए तैयार किया गया है। इसका उद्देश्य केवल दस्तावेज में लिखे टेक्स्ट को पढ़ना नहीं, बल्कि उसके लेआउट और जानकारी को समझकर उपयोगी डेटा के रूप में तैयार करना है।

सर्वम विजन 2.1 जटिल और नेस्टेड टेबल्स के साथ-साथ कई पेज में फैली टेबल्स को भी प्रोसेस कर सकता है। वहीं, स्ट्रक्चर्ड फॉर्म से नाम, तारीख और वित्तीय आंकड़ों जैसी महत्वपूर्ण जानकारी निकालने की क्षमता भी इसमें दी गई है।

मॉडल की एक अन्य खासियत भारतीय भाषाओं में लिखी हस्तलिखित सामग्री को पहचानना है। कंपनी के अनुसार, इसके प्रशिक्षण में अलग-अलग क्षेत्रीय हैंडराइटिंग पैटर्न को भी शामिल किया गया है।

कंपनी के मुताबिक, घने और अनियमित दस्तावेज स्कैन में होने वाली हैलुसिनेशन और स्पेसियल इनकंसिस्टेंसी को कम करने के लिए मॉडल को विशेष रूप से प्रशिक्षित किया गया है। इससे दस्तावेज में मौजूद टेक्स्ट के साथ उसके लेआउट को भी अधिक सटीकता से समझने का प्रयास किया गया है।

सर्वम एआई ने विजन 2.1 के साथ सर्वम इंडिया ओसीआर बेंचमार्क भी पेश किया है। कंपनी के अनुसार, इसमें भारत की सभी 22 आधिकारिक भाषाओं को शामिल किया गया है। बेंचमार्क में कुल 6,909 सैंपल हैं, जिनमें 6,609 क्षेत्रीय भाषाओं और 300 अंग्रेजी बेसलाइन सैंपल शामिल हैं।

इसके लिए अखबारों, ब्रोशर, किताबों और वर्ष 1800 से अब तक के ऐतिहासिक अभिलेखों से सामग्री ली गई है। कंपनी के मुताबिक, विजन 2.1 ने इस बेंचमार्क पर 87.39 प्रतिशत ओवरऑल वर्ड एक्यूरेसी हासिल की है। ग्लोबल olmOCR-बेंच पर इसका स्कोर 87.30 रहा।

विजन 2.1 को सिंथेटिक और रियल-वर्ल्ड डॉक्यूमेंट स्कैन्स के मिश्रण से प्रशिक्षित किया गया है। ट्रेनिंग में क्षेत्रीय हैंडराइटिंग और फॉर्म से डेटा निकालने से जुड़े मामलों पर विशेष ध्यान दिया गया। इसके बाद सुपरवाइज्ड लर्निंग के जरिए मॉडल को फाइन-ट्यून किया गया।

कंपनी ने मॉडल की टेक्स्चुअल और स्ट्रक्चरल एक्यूरेसी को बेहतर करने के लिए रेनफोर्समेंट लर्निंग विद वेरिएबल रिवार्ड्स (RLVR) का भी इस्तेमाल किया है।

सर्वम के अनुसार, नया मॉडल उन बिजनेस के लिए उपयोगी हो सकता है जहां बड़ी संख्या में स्कैन्ड दस्तावेज, फॉर्म और टेबल्स से डेटा निकालने की जरूरत होती है। इसका उद्देश्य अव्यवस्थित स्कैन्स को ऐसे स्ट्रक्चर्ड डेटा में बदलना है, जिसे प्रोडक्शन वर्कफ्लो में इस्तेमाल किया जा सके।

सर्वम विजन 2.1 को कंपनी के डॉक्यूमेंट इंटेलिजेंस एपीआई के जरिए उपलब्ध कराया गया है। इन एपीआई में मल्टी-पेज फाइलों को स्ट्रक्चर्ड टेक्स्ट में बदलने और फॉर्म्स व टेबल्स से ऑटोमैटिक डेटा एक्सट्रैक्शन की सुविधा शामिल है।

Leave a Reply

Your email address will not be published. Required fields are marked *