ശാസ്ത്ര സാങ്കേതിക വിദ്യ

ശ്രവാണി 1.0: 65 ഇന്ത്യൻ ഭാഷകൾക്കുള്ള ഓപ്പൺ സ്പീച്ച് മോഡൽ

ശ്രവാണി 1.0: 65 ഇന്ത്യൻ ഭാഷകൾക്കുള്ള ഓപ്പൺ സ്പീച്ച് മോഡൽ

എന്തുകൊണ്ട് വാർത്തകളിൽ?

65 ഇന്ത്യൻ ഭാഷകളും പ്രാദേശിക ഭാഷകളും ഉൾക്കൊള്ളുന്ന ഒരു ഓപ്പൺ ഓട്ടോമാറ്റിക് സ്പീച്ച് റെക്കഗ്നിഷൻ മോഡലായ സ്രവാണി 1.0 ഗവേഷകർ പുറത്തിറക്കി.

മോഡൽ എന്താണ് ചെയ്യുന്നത്

സംസാരിക്കുന്ന ഓഡിയോയെ ഓട്ടോമാറ്റിക് സ്പീച്ച് റെക്കഗ്നിഷൻ ടെക്സ്റ്റാക്കി മാറ്റുന്നു. ഇന്ത്യയിലെ ബഹുഭാഷാ സൗകര്യങ്ങൾക്കും കുറഞ്ഞ വിഭവങ്ങളുള്ള ചുറ്റുപാടുകൾക്കുമായാണ് സ്രവാണി രൂപകൽപ്പന ചെയ്തിരിക്കുന്നത്.

ഗവേഷക സംഘം ഒരു ഫാസ്റ്റ്കോൺഫോർമർ ആർക്കിടെക്ചറും ഒരു ഹൈബ്രിഡ് ഡീകോഡിംഗ് സിസ്റ്റവുമാണ് ഉപയോഗിച്ചത്. ഈ മോഡലിൽ ഏകദേശം 430 ദശലക്ഷം പാരാമീറ്ററുകൾ അടങ്ങിയിട്ടുണ്ട്.

105 ഭാഷകളിലായുള്ള 31,255 മണിക്കൂർ ദൈർഘ്യമുള്ള അൺലേബൽ ചെയ്യപ്പെട്ട വാണി സ്പീച്ച് പ്രീട്രെയിനിംഗിനായി ഉപയോഗിച്ചു. 65 വകഭേദങ്ങളിലായുള്ള 31,263 മണിക്കൂർ ദൈർഘ്യമുള്ള സ്പീച്ച് ആണ് ഫൈൻ ട്യൂണിംഗിനായി ഉപയോഗിച്ചത്.

ഒരു ഇന്റർമീഡിയറ്റ് സ്റ്റേജ് സംസാരത്തെ ജോടിയാക്കിയ ചിത്രങ്ങളുമായി വിന്യസിച്ചു. അർത്ഥപരമായ പ്രതിനിധാനങ്ങളെ ശക്തിപ്പെടുത്താനാണ് ഗവേഷകർ ഇത് ലക്ഷ്യമിട്ടത്.

ഡാറ്റയും വിലയിരുത്തലും

ഇന്ത്യൻ ഇൻസ്റ്റിറ്റ്യൂട്ട് ഓഫ് സയൻസ്, ആർട്ടിഫിഷ്യൽ ഇന്റലിജൻസ് ആൻഡ് റോബോട്ടിക്സ് ടെക്നോളജി പാർക്ക് എന്നിവയുടെ ഒരു സംരംഭമാണ് വാണി. രണ്ടാമത്തെ സ്ഥാപനം ARTPARK എന്ന പേരാണ് ഉപയോഗിക്കുന്നത്. സ്റ്റുഡിയോ റെക്കോർഡിംഗുകളെ മാത്രം ആശ്രയിക്കുന്നതിനുപകരം, ജില്ലാതലങ്ങളിലുള്ള സംസാരങ്ങളാണ് വാണി ശേഖരിക്കുന്നത്.

എട്ട് മാനദണ്ഡങ്ങളിലുടനീളം ഈ പ്രബന്ധം സ്രവാണിയെ വിലയിരുത്തി. ഒട്ടേറെ ഭാഷാ-ഡാറ്റാസെറ്റ് കോമ്പിനേഷനുകളിൽ ഇത് ശക്തമായ ഫലങ്ങൾ റിപ്പോർട്ട് ചെയ്തു.

വേഡ് എറർ റേറ്റ് റഫറൻസ് ടെക്സ്റ്റിനെതിരെയുള്ള ഉൾപ്പെടുത്തലുകൾ, ഇല്ലാതാക്കലുകൾ, പകരമുള്ളവ എന്നിവയെ അളക്കുന്നു. കുറഞ്ഞ മൂല്യങ്ങൾ സാധാരണയായി മികച്ച ട്രാൻസ്ക്രിപ്ഷനെയാണ് സൂചിപ്പിക്കുന്നത്.

പ്രകടനങ്ങൾ ഭാഷകളിലുടനീളം വ്യാപകമായി വ്യത്യാസപ്പെടുന്നു. ഈ വ്യതിയാനത്തെ മോഡൽ കാർഡ് തുറന്ന രീതിയിൽ ഫൈൻ ട്യൂണിംഗ് ഡാറ്റയുടെ അസമാനതകളുമായി ബന്ധിപ്പിക്കുന്നു.

ഹാഫ്-പ്രിസിഷൻ പരിവർത്തനത്തിന് ശേഷം പുറത്തിറക്കിയ മോഡലിന് ഏകദേശം 900 മെഗാബൈറ്റ് വലുപ്പമുണ്ട്. ഇതിന്റെ പ്രായോഗികമായ വിന്യാസത്തിന് ഇപ്പോഴും അനുയോജ്യമായ കമ്പ്യൂട്ടിംഗ് ഹാർഡ്‌വെയർ ആവശ്യമാണ്.

വ്യാപ്തി എന്നാൽ സമാനമായ ഗുണനിലവാരമല്ല

മോഡലിൽ ഒരു ഭാഷ ഉൾപ്പെട്ടതുകൊണ്ട് എല്ലാ ഉച്ചാരണങ്ങൾക്കും ശൈലികൾക്കും ശബ്ദായമാനമായ ചുറ്റുപാടുകൾക്കും വിശ്വസനീയമായ ട്രാൻസ്ക്രിപ്ഷൻ അത് ഉറപ്പുനൽകുന്നില്ല.

പൊതുമൂല്യവും സുരക്ഷാക്രമീകരണങ്ങളും

പ്രാദേശിക ഭാഷകളുടെ മികച്ച രീതിയിലുള്ള തിരിച്ചറിയലിന് ആരോഗ്യം, വിദ്യാഭ്യാസം, പ്രവേശനക്ഷമത, പൗരന്മാർക്കുള്ള സേവനങ്ങൾ എന്നിവയെ പിന്തുണയ്ക്കാൻ കഴിയും. കുത്തക മോഡലുകളെ ആശ്രയിക്കുന്നത് കുറയ്ക്കാനും ഇതിലൂടെ സാധിക്കും.

തുറന്ന വെയിറ്റുകൾ പരിശോധനയും അഡാപ്റ്റേഷനും സാധ്യമാക്കുന്നു. ആക്സസ് വ്യവസ്ഥകൾ, കമ്പ്യൂട്ടിംഗ് ആവശ്യങ്ങൾ, ലൈസൻസിംഗ് എന്നിവ ഇപ്പോഴും പ്രായോഗികമായ തുറന്ന സമീപനത്തെ രൂപപ്പെടുത്തുന്നു.

സംസാര വിവരങ്ങൾക്ക് ഐഡന്റിറ്റി, സ്ഥലം, സെൻസിറ്റീവ് വിവരങ്ങൾ എന്നിവ വെളിപ്പെടുത്താൻ കഴിയും. അതിനാൽ ശേഖരണത്തിനും പുനരുപയോഗത്തിനും വ്യക്തമായ സമ്മതവും സുരക്ഷയും ആവശ്യമാണ്.

ഓരോ ഭാഷകളുടെയും പിഴവ് നിരക്കുകളും പരാജയങ്ങളും വിന്യാസത്തിൽ പ്രസിദ്ധീകരിക്കണം. നിയമപരവും വൈദ്യശാസ്ത്രപരവും ക്ഷേമപരവുമായ തീരുമാനങ്ങൾക്ക് മനുഷ്യന്റെ വിലയിരുത്തലുകൾ അനിവാര്യമായി തുടരുന്നു.

ഉച്ചാരണ മാനദണ്ഡങ്ങളിലും ഡാറ്റാസെറ്റ് തിരുത്തലുകളിലും സമൂഹങ്ങൾ പങ്കാളികളാകണം. ഭാഷാപരമായ ഉൾപ്പെടുത്തൽ എന്നത് ഒരു സാങ്കേതിക മാനദണ്ഡം മാത്രമല്ല.

ഇത് ഉപയോഗിക്കുന്നിടത്ത് പരിശോധിക്കുക

സ്രവാണി വിലപ്പെട്ട ഒരു അടിത്തറയാണ്. യഥാർത്ഥ ലോകത്തെ ഓഡിറ്റുകൾ പ്രാദേശിക ഭാഷകൾ, ശബ്ദം, കോഡ് സ്വിച്ചിംഗ്, അനന്തരഫലമായുണ്ടാകുന്ന പിഴവുകൾ എന്നിവ പരിശോധിക്കേണ്ടതുണ്ട്.

ഉപസംഹാരം

ഈ റിലീസ് ഇന്ത്യയുടെ സ്പീച്ച് ടെക്നോളജി പൊതുമേഖലയെ വിപുലമാക്കുന്നു. സുതാര്യമായ വിലയിരുത്തലിലൂടെയും സമൂഹത്തിന്റെ നേതൃത്വത്തിലുള്ള മെച്ചപ്പെടുത്തലുകളിലൂടെയും ഇതിന്റെ സാമൂഹിക മൂല്യം വളരും.

Sources

Home Current Affairs 📰 Daily News 🎬 Watch Shorts 📊 Economic Survey 2025-26 Subjects 📚 All Subjects ⚖️ Indian Polity 💹 Economy 🌍 Geography 🌿 Environment 📜 History Exam Info 📋 Syllabus 2026 📝 Prelims Syllabus ✍️ Mains Syllabus ✅ Eligibility Resources 📖 Booklist 📊 Exam Pattern 📄 Previous Year Papers ▶️ YouTube Channel
Sign In