विज्ञापन - शीर्ष बैनर
Read in English —JantaScope English
कृत्रिम बुद्धिमत्ता समाचार

Sarvam AI का Saaras V4 लॉन्च: 22 भारतीय भाषाओं की आवाज को Text में बदल सकेगा नया Speech Model

भारतीय AI कंपनी Sarvam AI ने Saaras V4 speech recognition model पेश किया है, जो 22 भारतीय भाषाओं के साथ English को भी सपोर्ट करता है। नया मॉडल transcription, translation, transliteration, verbatim और code-mixed text जैसे पांच output modes देता है और noisy audio, regional accents तथा mixed-language conversations को संभालने के लिए डिजाइन किया गया है।

Sarvam AI का Saaras V4 लॉन्च: 22 भारतीय भाषाओं की आवाज को Text में बदल सकेगा नया Speech Model
विज्ञापन

द्वारा जीत निर्मल

स्रोत: Sarvam AI; additional reporting and context from Business Standard, Moneycontrol and NDTV Profit

भारत की भाषाई विविधता को ध्यान में रखकर बनाया गया Saaras V4

Sarvam AI ने अपने automatic speech recognition (ASR) model की नई generation Saaras V4 पेश की है। कंपनी का कहना है कि यह मॉडल भारत की multilingual speech को समझने के लिए बनाया गया है और 22 भारतीय भाषाओं के साथ English को सपोर्ट करता है।

Sarvam AI की आधिकारिक जानकारी के अनुसार, Saaras V4 को code-mixed conversations, अलग-अलग dialects और background noise जैसी वास्तविक परिस्थितियों में speech recognition के लिए तैयार किया गया है।

मॉडल Hindi, Bengali, Kannada, Malayalam, Marathi, Odia, Punjabi, Tamil, Telugu, Gujarati, Assamese, Urdu, Nepali, Konkani, Kashmiri, Sindhi, Sanskrit, Santali, Manipuri, Bodo, Maithili और Dogri जैसी भारतीय भाषाओं को सपोर्ट करता है। English support भी उपलब्ध है।

एक Audio से पांच तरह के Output

Saaras V4 की प्रमुख विशेषताओं में एक ही audio input को अलग-अलग जरूरतों के अनुसार पांच formats में process करने की क्षमता शामिल है।

Transcribe mode spoken content को native script में लिख सकता है और numbers तथा dates जैसी चीजों को normalize करता है।

Verbatim mode वक्ता ने जिस तरह शब्द बोले हैं, उन्हें उसी रूप के करीब बनाए रखने पर केंद्रित है।

Codemix mode ऐसी बातचीत के लिए है जिसमें दो भाषाएं एक साथ इस्तेमाल होती हैं—उदाहरण के लिए Hindi के बीच English words।

Translit mode भारतीय भाषा की speech को English/Roman script में प्रस्तुत कर सकता है।

वहीं Translate mode spoken content का English translation तैयार करता है।

Sarvam AI का कहना है कि ये पांचों capabilities एक ही model के भीतर मौजूद हैं और अलग-अलग post-processing systems की आवश्यकता कम करती हैं।

3 Billion Parameter Language Model का इस्तेमाल

Saaras V4 की architecture में एक audio encoder के साथ 3-billion-parameter hybrid state-space language model शामिल है।

Sarvam AI के अनुसार, language model को कंपनी ने अपने स्तर पर scratch से train किया है।

कंपनी का कहना है कि architecture को खास तौर पर ऐसी speech के लिए तैयार किया गया है जिसमें regional accents, dialect variation, background noise और एक ही conversation में भाषाओं का बदलना शामिल हो सकता है।

यह भारत जैसे बाजार में महत्वपूर्ण हो सकता है, जहां रोजमर्रा की बातचीत में Hindi-English जैसे combinations के साथ कई regional-language और English combinations आम हैं।

भाषा पहचान में 5.22% Error Rate का दावा

Sarvam AI ने Saaras V4 की language-identification क्षमता के बारे में भी benchmark results जारी किए हैं।

कंपनी के अनुसार, verified IndicVoices data पर सभी 22 भारतीय भाषाओं में language-identification error rate 5.22% रहा।

वहीं भारत में सबसे अधिक बोली जाने वाली 10 भाषाओं के लिए यह error rate 2.9% बताया गया है।

ये परिणाम Sarvam AI द्वारा जारी evaluation figures हैं। इन्हें स्वतंत्र third-party validation के परिणाम के रूप में नहीं देखा जाना चाहिए।

Sarvam AI का दावा: सभी 22 भारतीय भाषाओं में SOTA Performance

Sarvam AI का दावा है कि Saaras V4 ने उसके evaluations में सभी 22 भारतीय भाषाओं में state-of-the-art (SOTA) performance हासिल की।

English के लिए भी कंपनी ने सात datasets पर model को evaluate किया। Sarvam AI के अनुसार, इन datasets में Indian English के साथ अलग-अलग international English accents और speech conditions शामिल थे और Saaras V4 ने tested systems में सबसे कम average Word Error Rate दर्ज किया।

यह भी कंपनी द्वारा रिपोर्ट किया गया benchmark result है और विभिन्न models के बीच वास्तविक performance audio quality, भाषा, accent, domain और testing methodology के आधार पर अलग हो सकती है।

Multi-Speaker Audio भी संभाल सकता है Model

Saaras V4 की एक और उपयोगी क्षमता multi-speaker speech recognition है।

Sarvam AI के मुताबिक, मॉडल एक ही processing flow में speaker diarisation और transcription को जोड़ सकता है।

Speaker diarisation का अर्थ है यह पहचानना कि बातचीत के अलग-अलग हिस्सों में कौन-सा speaker बोल रहा है।

इस तरह की capability customer-support calls, interviews, meetings और दूसरे multi-speaker recordings में उपयोगी हो सकती है, जहां केवल transcript तैयार करना पर्याप्त नहीं होता और यह जानना भी जरूरी होता है कि कौन-सी बात किस speaker ने कही।

Keyterm Prompting भी उपलब्ध

Sarvam AI की API documentation के मुताबिक Saaras V4 Keyterm Prompting भी सपोर्ट करता है।

Developers REST और Batch APIs में अधिकतम 50 domain-specific names, places, brands या technical terms दे सकते हैं, ताकि speech recognition system को उन विशेष शब्दों की पहचान की ओर guide किया जा सके।

यह सुविधा medical terminology, company names, product names या industry-specific vocabulary वाले applications में उपयोगी हो सकती है।

हालांकि Sarvam AI की documentation के अनुसार keyterms feature V4 के REST और Batch APIs पर उपलब्ध है, streaming endpoint पर नहीं।

Real-Time और Batch Processing के विकल्प

Saaras V4 केवल prerecorded छोटे audio clips तक सीमित नहीं है।

Sarvam AI documentation के मुताबिक model REST, Batch और WebSocket-based speech-to-text workflows में उपलब्ध है। V4 को Realtime API पर भी उपलब्ध कराया गया है।

इससे developers इसे voice agents, call analytics, customer support, meetings और दूसरे speech-based applications में integrate कर सकते हैं।

Sarvam AI ने 2 सितंबर 2026 को Saaras V4 को अपने Voice Agents के लिए generally available किए जाने की घोषणा भी की थी।

Saaras V4 क्यों महत्वपूर्ण हो सकता है?

Generative AI की चर्चा अक्सर text और image models के आसपास केंद्रित रहती है, लेकिन भारत में voice AI की भूमिका अलग कारणों से महत्वपूर्ण है।

भारत में digital services को उन users तक पहुंचाने के लिए speech interface उपयोगी हो सकता है जो English-first keyboard interfaces की तुलना में अपनी स्थानीय भाषा में बोलना अधिक सहज समझते हैं।

इसके संभावित applications customer-support systems, call centres, voice assistants, meeting transcription, media transcription और multilingual enterprise applications तक फैले हो सकते हैं।

लेकिन किसी भी speech-recognition system की वास्तविक उपयोगिता केवल benchmark scores से तय नहीं होती। अलग accents, कमजोर microphones, background noise, overlapping speakers और specialised terminology जैसे factors production environment में accuracy को प्रभावित कर सकते हैं।

इसलिए Saaras V4 की वास्तविक competitive position को समझने के लिए independent benchmarks और बड़े पैमाने पर real-world deployment के परिणाम भी महत्वपूर्ण होंगे।

Sarvam AI के बड़े AI Ecosystem का हिस्सा

Saaras V4 का विकास Sarvam AI के broader India-focused AI stack का हिस्सा है।

कंपनी language models के अलावा speech, voice agents, vision और enterprise AI infrastructure पर भी काम कर रही है।

इस संदर्भ में Saaras V4 का महत्व केवल speech-to-text model के रूप में नहीं है। 22 भारतीय भाषाओं, code-mixed conversations और regional speech patterns पर focus इसे भारत में multilingual voice applications के लिए तैयार किए जा रहे broader AI infrastructure का हिस्सा बनाता है।

Performance and benchmark figures are based on Sarvam AI's published evaluations.


Source

Primary Source: Sarvam AI — Introducing Saaras V4, official product announcement and Sarvam API documentation.

News Source: Business Standard, 25 September 2026 — “Saaras V4: Sarvam AI's new speech model can transcribe 22 Indian languages.”

Additional Context: Moneycontrol और NDTV Profit की Saaras V4 पर technology reporting.

साझा करें
विज्ञापन - मध्य लेख
विज्ञापन - नीचे