వార్తల్లో ఎందుకు ఉంది?
65 భారతీయ భాషలు మరియు మాండలికాలను కవర్ చేసే ఒక ఓపెన్ ఆటోమేటిక్ స్పీచ్ రికగ్నిషన్ మోడల్ అయిన శ్రవాణి 1.0 (SraVaani 1.0) ను పరిశోధకులు విడుదల చేశారు.
ఈ మోడల్ ఏం చేస్తుంది
ఆటోమేటిక్ స్పీచ్ రికగ్నిషన్ మాట్లాడిన ఆడియోను టెక్స్ట్గా మారుస్తుంది. భారతదేశ బహుభాషా మరియు తక్కువ వనరులున్న పరిస్థితుల కోసం శ్రవాణి రూపొందించబడింది.
పరిశోధక బృందం ఫాస్ట్కన్ఫార్మర్ (FastConformer) ఆర్కిటెక్చర్ మరియు హైబ్రిడ్ డీకోడింగ్ సిస్టమ్ను ఉపయోగించింది. ఈ మోడల్ సుమారు 430 మిలియన్ల పారామితులను కలిగి ఉంది.
ప్రీట్రైనింగ్ కోసం 105 భాషలలో లేబుల్ చేయని 31,255 గంటల వాణి (Vaani) స్పీచ్ను ఉపయోగించారు. ఫైన్-ట్యూనింగ్ కోసం 65 భాషా వైవిధ్యాలలో సుమారు 31,263 గంటల ఆడియోను ఉపయోగించారు.
ఒక మధ్యంతర దశలో స్పీచ్ను జత చేసిన చిత్రాలతో అనుసంధానం చేశారు. సిమాంటిక్ (అర్థపరమైన) ప్రాతినిధ్యాలను బలోపేతం చేయడానికి పరిశోధకులు దీనిని ఉద్దేశించారు.
డేటా మరియు మూల్యాంకనం
వాణి (Vaani) అనేది ఇండియన్ ఇన్స్టిట్యూట్ ఆఫ్ సైన్స్ మరియు ఆర్టిఫిషియల్ ఇంటెలిజెన్స్ అండ్ రోబోటిక్స్ టెక్నాలజీ పార్క్ యొక్క చొరవ. రెండవ సంస్థ ఆర్ట్పార్క్ (ARTPARK) అనే పేరును ఉపయోగిస్తుంది. వాణి కేవలం స్టూడియో రికార్డింగ్లపై మాత్రమే ఆధారపడకుండా జిల్లా-స్థాయి స్పీచ్ను సేకరిస్తుంది.
పరిశోధనా పత్రం శ్రవాణిని ఎనిమిది బెంచ్మార్క్లలో అంచనా వేసింది. ఇది అనేక భాషా-మరియు-డేటాసెట్ కలయికలపై బలమైన ఫలితాలను నివేదించింది.
వర్డ్ ఎర్రర్ రేట్ (Word Error Rate) రిఫరెన్స్ టెక్స్ట్కి వ్యతిరేకంగా చొప్పించినవి, తొలగించినవి మరియు ప్రత్యామ్నాయాలను కొలుస్తుంది. తక్కువ విలువలు సాధారణంగా మెరుగైన ట్రాన్స్క్రిప్షన్ను సూచిస్తాయి.
భాషలను బట్టి పనితీరు విస్తృతంగా మారుతుంది. అసమాన ఫైన్-ట్యూనింగ్ డేటా వల్ల ఈ వైవిధ్యం ఏర్పడిందని మోడల్ కార్డ్ బహిరంగంగా స్పష్టం చేస్తుంది.
హాఫ్-ప్రిసిషన్ మార్పిడి తర్వాత విడుదలైన మోడల్ పరిమాణం సుమారు 900 మెగాబైట్లు. దీని ఆచరణాత్మక విస్తరణకు ఇప్పటికీ తగిన కంప్యూటింగ్ హార్డ్వేర్ అవసరం.
కవరేజ్ అంటే సమాన నాణ్యత కాదు
ఒక భాష ఈ మోడల్లో ఉన్నంత మాత్రాన, ప్రతి యాసకు, డొమైన్కు లేదా సందడిగా ఉండే వాతావరణానికి నమ్మకమైన ట్రాన్స్క్రిప్షన్కు అది హామీ ఇవ్వదు.
ప్రజా ప్రయోజనం మరియు భద్రతా చర్యలు
మెరుగైన స్థానిక-భాషా రికగ్నిషన్ అనేది ఆరోగ్యం, విద్య, ప్రాప్యత మరియు పౌర సేవలకు మద్దతు ఇస్తుంది. ఇది యాజమాన్య మోడల్స్పై ఆధారపడటాన్ని కూడా తగ్గిస్తుంది.
ఓపెన్ వెయిట్స్ పరీక్షించడానికి మరియు అనుసరణకు వీలు కల్పిస్తాయి. యాక్సెస్ షరతులు, అవసరమైన కంప్యూట్ సామర్థ్యం మరియు లైసెన్సింగ్ ఇప్పటికీ ఆచరణాత్మక బహిరంగతను ఆకృతి చేస్తాయి.
స్పీచ్ డేటా గుర్తింపును, స్థానాన్ని మరియు సున్నితమైన సమాచారాన్ని బహిర్గతం చేస్తుంది. కాబట్టి దీని సేకరణ మరియు పునర్వినియోగానికి అర్థవంతమైన సమ్మతి మరియు భద్రత అవసరం.
మోడల్ డిప్లాయ్మెంట్ భాషల వారీగా ఎర్రర్ రేట్లు మరియు వైఫల్యాలను ప్రచురించాలి. చట్టపరమైన, వైద్య మరియు సంక్షేమ నిర్ణయాల కోసం మానవ సమీక్ష ఇప్పటికీ అవసరం.
ఉచ్చారణ ప్రమాణాలు మరియు డేటాసెట్ సవరణలో సంఘాలు పాల్గొనాలి. భాషాపరమైన చేరిక అనేది కేవలం సాంకేతిక ప్రమాణం మాత్రమే కాదు.
ఉపయోగించే చోటనే పరీక్షించండి
శ్రవాణి ఒక విలువైన పునాది. కానీ నిజ-ప్రపంచ తనిఖీలు మాండలికాలు, సందడి, కోడ్-స్విచింగ్ మరియు పర్యవసానాలకు దారితీసే లోపాలను పరిశీలించాలి.
ముగింపు
ఈ విడుదల భారతదేశ స్పీచ్-టెక్నాలజీ వనరులను విస్తృతం చేస్తుంది. పారదర్శక మూల్యాంకనం మరియు కమ్యూనిటీ-ఆధారిత మెరుగుదల ద్వారా దీని సామాజిక విలువ పెరుగుతుంది.