सर्वम एआई ने लॉन्च किया विजन 2.1, जटिल दस्तावेजों और भारतीय भाषाओं की हैंडराइटिंग को समझने में सक्षम
नई दिल्ली। आर्टिफिशियल इंटेलिजेंस के क्षेत्र में सर्वम एआई ने अपना नया विजन-लैंग्वेज मॉडल सर्वम विजन 2.1 लॉन्च किया है। कंपनी के मुताबिक, नया मॉडल पुराने और जटिल दस्तावेजों, अनियमित स्कैन, टेबल, फॉर्म और हस्तलिखित सामग्री को समझकर उसमें मौजूद जानकारी को स्ट्रक्चर्ड डेटा में बदल सकता है। इस डेटा का इस्तेमाल बिजनेस अपने प्रोडक्शन वर्कफ्लो में सीधे कर सकते हैं।
कंपनी ने बताया कि विजन 2.1 को पिछले मॉडल की सीमाओं को ध्यान में रखते हुए तैयार किया गया है। इसका उद्देश्य केवल दस्तावेज में लिखे टेक्स्ट को पढ़ना नहीं, बल्कि उसके लेआउट और जानकारी को समझकर उपयोगी डेटा के रूप में तैयार करना है।
सर्वम विजन 2.1 जटिल और नेस्टेड टेबल्स के साथ-साथ कई पेज में फैली टेबल्स को भी प्रोसेस कर सकता है। वहीं, स्ट्रक्चर्ड फॉर्म से नाम, तारीख और वित्तीय आंकड़ों जैसी महत्वपूर्ण जानकारी निकालने की क्षमता भी इसमें दी गई है।
मॉडल की एक अन्य खासियत भारतीय भाषाओं में लिखी हस्तलिखित सामग्री को पहचानना है। कंपनी के अनुसार, इसके प्रशिक्षण में अलग-अलग क्षेत्रीय हैंडराइटिंग पैटर्न को भी शामिल किया गया है।
कंपनी के मुताबिक, घने और अनियमित दस्तावेज स्कैन में होने वाली हैलुसिनेशन और स्पेसियल इनकंसिस्टेंसी को कम करने के लिए मॉडल को विशेष रूप से प्रशिक्षित किया गया है। इससे दस्तावेज में मौजूद टेक्स्ट के साथ उसके लेआउट को भी अधिक सटीकता से समझने का प्रयास किया गया है।
सर्वम एआई ने विजन 2.1 के साथ सर्वम इंडिया ओसीआर बेंचमार्क भी पेश किया है। कंपनी के अनुसार, इसमें भारत की सभी 22 आधिकारिक भाषाओं को शामिल किया गया है। बेंचमार्क में कुल 6,909 सैंपल हैं, जिनमें 6,609 क्षेत्रीय भाषाओं और 300 अंग्रेजी बेसलाइन सैंपल शामिल हैं।
इसके लिए अखबारों, ब्रोशर, किताबों और वर्ष 1800 से अब तक के ऐतिहासिक अभिलेखों से सामग्री ली गई है। कंपनी के मुताबिक, विजन 2.1 ने इस बेंचमार्क पर 87.39 प्रतिशत ओवरऑल वर्ड एक्यूरेसी हासिल की है। ग्लोबल olmOCR-बेंच पर इसका स्कोर 87.30 रहा।
विजन 2.1 को सिंथेटिक और रियल-वर्ल्ड डॉक्यूमेंट स्कैन्स के मिश्रण से प्रशिक्षित किया गया है। ट्रेनिंग में क्षेत्रीय हैंडराइटिंग और फॉर्म से डेटा निकालने से जुड़े मामलों पर विशेष ध्यान दिया गया। इसके बाद सुपरवाइज्ड लर्निंग के जरिए मॉडल को फाइन-ट्यून किया गया।
कंपनी ने मॉडल की टेक्स्चुअल और स्ट्रक्चरल एक्यूरेसी को बेहतर करने के लिए रेनफोर्समेंट लर्निंग विद वेरिएबल रिवार्ड्स (RLVR) का भी इस्तेमाल किया है।
सर्वम के अनुसार, नया मॉडल उन बिजनेस के लिए उपयोगी हो सकता है जहां बड़ी संख्या में स्कैन्ड दस्तावेज, फॉर्म और टेबल्स से डेटा निकालने की जरूरत होती है। इसका उद्देश्य अव्यवस्थित स्कैन्स को ऐसे स्ट्रक्चर्ड डेटा में बदलना है, जिसे प्रोडक्शन वर्कफ्लो में इस्तेमाल किया जा सके।
सर्वम विजन 2.1 को कंपनी के डॉक्यूमेंट इंटेलिजेंस एपीआई के जरिए उपलब्ध कराया गया है। इन एपीआई में मल्टी-पेज फाइलों को स्ट्रक्चर्ड टेक्स्ट में बदलने और फॉर्म्स व टेबल्स से ऑटोमैटिक डेटा एक्सट्रैक्शन की सुविधा शामिल है।
