ശാസ്ത്ര സാങ്കേതിക വിദ്യ

ശ്രവാണി 1.0: 65 ഇന്ത്യൻ ഭാഷകൾക്കുള്ള ഓപ്പൺ സ്പീച്ച് മോഡൽ

ശ്രവാണി 1.0: 65 ഇന്ത്യൻ ഭാഷകൾക്കുള്ള ഓപ്പൺ സ്പീച്ച് മോഡൽ

എന്തുകൊണ്ട് വാർത്തകളിൽ?

65 ഇന്ത്യൻ ഭാഷകളും പ്രാദേശിക ഭാഷകളും ഉൾക്കൊള്ളുന്ന ഒരു ഓപ്പൺ ഓട്ടോമാറ്റിക് സ്പീച്ച് റെക്കഗ്നിഷൻ മോഡലായ സ്രവാണി 1.0 ഗവേഷകർ പുറത്തിറക്കി.

മോഡൽ എന്താണ് ചെയ്യുന്നത്

സംസാരിക്കുന്ന ഓഡിയോയെ ഓട്ടോമാറ്റിക് സ്പീച്ച് റെക്കഗ്നിഷൻ ടെക്സ്റ്റാക്കി മാറ്റുന്നു. ഇന്ത്യയിലെ ബഹുഭാഷാ സൗകര്യങ്ങൾക്കും കുറഞ്ഞ വിഭവങ്ങളുള്ള ചുറ്റുപാടുകൾക്കുമായാണ് സ്രവാണി രൂപകൽപ്പന ചെയ്തിരിക്കുന്നത്.

ഗവേഷക സംഘം ഒരു ഫാസ്റ്റ്കോൺഫോർമർ ആർക്കിടെക്ചറും ഒരു ഹൈബ്രിഡ് ഡീകോഡിംഗ് സിസ്റ്റവുമാണ് ഉപയോഗിച്ചത്. ഈ മോഡലിൽ ഏകദേശം 430 ദശലക്ഷം പാരാമീറ്ററുകൾ അടങ്ങിയിട്ടുണ്ട്.

105 ഭാഷകളിലായുള്ള 31,255 മണിക്കൂർ ദൈർഘ്യമുള്ള അൺലേബൽ ചെയ്യപ്പെട്ട വാണി സ്പീച്ച് പ്രീട്രെയിനിംഗിനായി ഉപയോഗിച്ചു. 65 വകഭേദങ്ങളിലായുള്ള 31,263 മണിക്കൂർ ദൈർഘ്യമുള്ള സ്പീച്ച് ആണ് ഫൈൻ ട്യൂണിംഗിനായി ഉപയോഗിച്ചത്.

ഒരു ഇന്റർമീഡിയറ്റ് സ്റ്റേജ് സംസാരത്തെ ജോടിയാക്കിയ ചിത്രങ്ങളുമായി വിന്യസിച്ചു. അർത്ഥപരമായ പ്രതിനിധാനങ്ങളെ ശക്തിപ്പെടുത്താനാണ് ഗവേഷകർ ഇത് ലക്ഷ്യമിട്ടത്.

ഡാറ്റയും വിലയിരുത്തലും

ഇന്ത്യൻ ഇൻസ്റ്റിറ്റ്യൂട്ട് ഓഫ് സയൻസ്, ആർട്ടിഫിഷ്യൽ ഇന്റലിജൻസ് ആൻഡ് റോബോട്ടിക്സ് ടെക്നോളജി പാർക്ക് എന്നിവയുടെ ഒരു സംരംഭമാണ് വാണി. രണ്ടാമത്തെ സ്ഥാപനം ARTPARK എന്ന പേരാണ് ഉപയോഗിക്കുന്നത്. സ്റ്റുഡിയോ റെക്കോർഡിംഗുകളെ മാത്രം ആശ്രയിക്കുന്നതിനുപകരം, ജില്ലാതലങ്ങളിലുള്ള സംസാരങ്ങളാണ് വാണി ശേഖരിക്കുന്നത്.

എട്ട് മാനദണ്ഡങ്ങളിലുടനീളം ഈ പ്രബന്ധം സ്രവാണിയെ വിലയിരുത്തി. ഒട്ടേറെ ഭാഷാ-ഡാറ്റാസെറ്റ് കോമ്പിനേഷനുകളിൽ ഇത് ശക്തമായ ഫലങ്ങൾ റിപ്പോർട്ട് ചെയ്തു.

വേഡ് എറർ റേറ്റ് റഫറൻസ് ടെക്സ്റ്റിനെതിരെയുള്ള ഉൾപ്പെടുത്തലുകൾ, ഇല്ലാതാക്കലുകൾ, പകരമുള്ളവ എന്നിവയെ അളക്കുന്നു. കുറഞ്ഞ മൂല്യങ്ങൾ സാധാരണയായി മികച്ച ട്രാൻസ്ക്രിപ്ഷനെയാണ് സൂചിപ്പിക്കുന്നത്.

പ്രകടനങ്ങൾ ഭാഷകളിലുടനീളം വ്യാപകമായി വ്യത്യാസപ്പെടുന്നു. ഈ വ്യതിയാനത്തെ മോഡൽ കാർഡ് തുറന്ന രീതിയിൽ ഫൈൻ ട്യൂണിംഗ് ഡാറ്റയുടെ അസമാനതകളുമായി ബന്ധിപ്പിക്കുന്നു.

ഹാഫ്-പ്രിസിഷൻ പരിവർത്തനത്തിന് ശേഷം പുറത്തിറക്കിയ മോഡലിന് ഏകദേശം 900 മെഗാബൈറ്റ് വലുപ്പമുണ്ട്. ഇതിന്റെ പ്രായോഗികമായ വിന്യാസത്തിന് ഇപ്പോഴും അനുയോജ്യമായ കമ്പ്യൂട്ടിംഗ് ഹാർഡ്‌വെയർ ആവശ്യമാണ്.

വ്യാപ്തി എന്നാൽ സമാനമായ ഗുണനിലവാരമല്ല

മോഡലിൽ ഒരു ഭാഷ ഉൾപ്പെട്ടതുകൊണ്ട് എല്ലാ ഉച്ചാരണങ്ങൾക്കും ശൈലികൾക്കും ശബ്ദായമാനമായ ചുറ്റുപാടുകൾക്കും വിശ്വസനീയമായ ട്രാൻസ്ക്രിപ്ഷൻ അത് ഉറപ്പുനൽകുന്നില്ല.

പൊതുമൂല്യവും സുരക്ഷാക്രമീകരണങ്ങളും

പ്രാദേശിക ഭാഷകളുടെ മികച്ച രീതിയിലുള്ള തിരിച്ചറിയലിന് ആരോഗ്യം, വിദ്യാഭ്യാസം, പ്രവേശനക്ഷമത, പൗരന്മാർക്കുള്ള സേവനങ്ങൾ എന്നിവയെ പിന്തുണയ്ക്കാൻ കഴിയും. കുത്തക മോഡലുകളെ ആശ്രയിക്കുന്നത് കുറയ്ക്കാനും ഇതിലൂടെ സാധിക്കും.

തുറന്ന വെയിറ്റുകൾ പരിശോധനയും അഡാപ്റ്റേഷനും സാധ്യമാക്കുന്നു. ആക്സസ് വ്യവസ്ഥകൾ, കമ്പ്യൂട്ടിംഗ് ആവശ്യങ്ങൾ, ലൈസൻസിംഗ് എന്നിവ ഇപ്പോഴും പ്രായോഗികമായ തുറന്ന സമീപനത്തെ രൂപപ്പെടുത്തുന്നു.

സംസാര വിവരങ്ങൾക്ക് ഐഡന്റിറ്റി, സ്ഥലം, സെൻസിറ്റീവ് വിവരങ്ങൾ എന്നിവ വെളിപ്പെടുത്താൻ കഴിയും. അതിനാൽ ശേഖരണത്തിനും പുനരുപയോഗത്തിനും വ്യക്തമായ സമ്മതവും സുരക്ഷയും ആവശ്യമാണ്.

ഓരോ ഭാഷകളുടെയും പിഴവ് നിരക്കുകളും പരാജയങ്ങളും വിന്യാസത്തിൽ പ്രസിദ്ധീകരിക്കണം. നിയമപരവും വൈദ്യശാസ്ത്രപരവും ക്ഷേമപരവുമായ തീരുമാനങ്ങൾക്ക് മനുഷ്യന്റെ വിലയിരുത്തലുകൾ അനിവാര്യമായി തുടരുന്നു.

ഉച്ചാരണ മാനദണ്ഡങ്ങളിലും ഡാറ്റാസെറ്റ് തിരുത്തലുകളിലും സമൂഹങ്ങൾ പങ്കാളികളാകണം. ഭാഷാപരമായ ഉൾപ്പെടുത്തൽ എന്നത് ഒരു സാങ്കേതിക മാനദണ്ഡം മാത്രമല്ല.

ഇത് ഉപയോഗിക്കുന്നിടത്ത് പരിശോധിക്കുക

സ്രവാണി വിലപ്പെട്ട ഒരു അടിത്തറയാണ്. യഥാർത്ഥ ലോകത്തെ ഓഡിറ്റുകൾ പ്രാദേശിക ഭാഷകൾ, ശബ്ദം, കോഡ് സ്വിച്ചിംഗ്, അനന്തരഫലമായുണ്ടാകുന്ന പിഴവുകൾ എന്നിവ പരിശോധിക്കേണ്ടതുണ്ട്.

ഉപസംഹാരം

ഈ റിലീസ് ഇന്ത്യയുടെ സ്പീച്ച് ടെക്നോളജി പൊതുമേഖലയെ വിപുലമാക്കുന്നു. സുതാര്യമായ വിലയിരുത്തലിലൂടെയും സമൂഹത്തിന്റെ നേതൃത്വത്തിലുള്ള മെച്ചപ്പെടുത്തലുകളിലൂടെയും ഇതിന്റെ സാമൂഹിക മൂല്യം വളരും.

Sources

Sign in Today’s news
Current affairs Daily news Daily quiz News Blitz Shorts Economic Survey 2025-26 Subjects
Polity Economy Geography Environment History Science & Tech Intl. Relations Internal Security Art & Culture Social Issues
All subjects Exam info UPSC Syllabus Prelims syllabus Mains syllabus Exam pattern Eligibility & attempts OBC & EWS checker Resources Free downloads Booklist 2026 Previous year papers Video notes YouTube channel