Science & Technology

ಶ್ರವಾಣಿ 1.0: 65 ಭಾರತೀಯ ಭಾಷೆಗಳಿಗೆ ಮುಕ್ತ ಧ್ವನಿ ಮಾದರಿ

ಶ್ರವಾಣಿ 1.0: 65 ಭಾರತೀಯ ಭಾಷೆಗಳಿಗೆ ಮುಕ್ತ ಧ್ವನಿ ಮಾದರಿ

ಸುದ್ದಿಯಲ್ಲಿ ಏಕೆ?

ಸಂಶೋಧಕರು 65 ಭಾರತೀಯ ಭಾಷೆಗಳು ಮತ್ತು ಉಪಭಾಷೆಗಳನ್ನು ಒಳಗೊಂಡಿರುವ ಓಪನ್ ಆಟೋಮ್ಯಾಟಿಕ್ ಸ್ಪೀಚ್ ರೆಕಗ್ನಿಷನ್ (Automatic Speech Recognition) ಮಾದರಿಯಾದ ಶ್ರವಾಣಿ 1.0 (SraVaani 1.0) ಅನ್ನು ಬಿಡುಗಡೆ ಮಾಡಿದ್ದಾರೆ.

ಮಾದರಿಯು ಏನು ಮಾಡುತ್ತದೆ

ಆಟೋಮ್ಯಾಟಿಕ್ ಸ್ಪೀಚ್ ರೆಕಗ್ನಿಷನ್ ಮಾತನಾಡುವ ಆಡಿಯೊವನ್ನು ಪಠ್ಯವಾಗಿ ಪರಿವರ್ತಿಸುತ್ತದೆ. ಭಾರತದ ಬಹುಭಾಷಾ ಮತ್ತು ಕಡಿಮೆ-ಸಂಪನ್ಮೂಲ ಸೆಟ್ಟಿಂಗ್‌ಗಾಗಿ ಶ್ರವಾಣಿಯನ್ನು ವಿನ್ಯಾಸಗೊಳಿಸಲಾಗಿದೆ.

ಸಂಶೋಧನಾ ತಂಡವು ಫಾಸ್ಟ್‌ಕನ್ಫಾರ್ಮರ್ (FastConformer) ಆರ್ಕಿಟೆಕ್ಚರ್ ಮತ್ತು ಹೈಬ್ರಿಡ್ ಡಿಕೋಡಿಂಗ್ ಸಿಸ್ಟಮ್ ಅನ್ನು ಬಳಸಿದೆ. ಮಾದರಿಯು ಸುಮಾರು 430 ಮಿಲಿಯನ್ ನಿಯತಾಂಕಗಳನ್ನು ಒಳಗೊಂಡಿದೆ.

ಪೂರ್ವ-ತರಬೇತಿಯು 105 ಭಾಷೆಗಳಾದ್ಯಂತ 31,255 ಗಂಟೆಗಳ ಲೇಬಲ್ ಮಾಡದ ವಾಣಿ ಭಾಷಣವನ್ನು ಬಳಸಿದೆ. ಫೈನ್-ಟ್ಯೂನಿಂಗ್ 65 ಪ್ರಭೇದಗಳಾದ್ಯಂತ ಸುಮಾರು 31,263 ಗಂಟೆಗಳನ್ನು ಬಳಸಿದೆ.

ಒಂದು ಮಧ್ಯಂತರ ಹಂತವು ಜೋಡಿಯಾದ ಚಿತ್ರಗಳೊಂದಿಗೆ ಭಾಷಣವನ್ನು ಜೋಡಿಸಿತು. ಲಾಕ್ಷಣಿಕ ಪ್ರಾತಿನಿಧ್ಯಗಳನ್ನು ಬಲಪಡಿಸಲು ಸಂಶೋಧಕರು ಇದನ್ನು ಉದ್ದೇಶಿಸಿದ್ದರು.

ಡೇಟಾ ಮತ್ತು ಮೌಲ್ಯಮಾಪನ

ವಾಣಿ ಎಂಬುದು ಇಂಡಿಯನ್ ಇನ್‌ಸ್ಟಿಟ್ಯೂಟ್ ಆಫ್ ಸೈನ್ಸ್ ಮತ್ತು ಆರ್ಟಿಫಿಶಿಯಲ್ ಇಂಟೆಲಿಜೆನ್ಸ್ ಮತ್ತು ರೊಬೊಟಿಕ್ಸ್ ಟೆಕ್ನಾಲಜಿ ಪಾರ್ಕ್‌ನ ಉಪಕ್ರಮವಾಗಿದೆ. ಎರಡನೇ ಸಂಸ್ಥೆಯು ARTPARK ಎಂಬ ಹೆಸರನ್ನು ಬಳಸುತ್ತದೆ. ವಾಣಿಯು ಸ್ಟುಡಿಯೋ ರೆಕಾರ್ಡಿಂಗ್‌ಗಳನ್ನು ಮಾತ್ರ ಅವಲಂಬಿಸುವ ಬದಲು ಜಿಲ್ಲಾ ಮಟ್ಟದ ಭಾಷಣವನ್ನು ಸಂಗ್ರಹಿಸುತ್ತದೆ.

ಪತ್ರಿಕೆಯು ಎಂಟು ಮಾನದಂಡಗಳಾದ್ಯಂತ ಶ್ರವಾಣಿಯನ್ನು ಮೌಲ್ಯಮಾಪನ ಮಾಡಿದೆ. ಇದು ಅನೇಕ ಭಾಷೆ-ಮತ್ತು-ಡೇಟಾಸೆಟ್ ಸಂಯೋಜನೆಗಳಲ್ಲಿ ಬಲವಾದ ಫಲಿತಾಂಶಗಳನ್ನು ವರದಿ ಮಾಡಿದೆ.

ವರ್ಡ್ ಎರರ್ ರೇಟ್ (Word Error Rate) ಉಲ್ಲೇಖ ಪಠ್ಯದ ವಿರುದ್ಧ ಅಳವಡಿಕೆಗಳು, ಅಳಿಸುವಿಕೆಗಳು ಮತ್ತು ಪರ್ಯಾಯಗಳನ್ನು ಅಳೆಯುತ್ತದೆ. ಕಡಿಮೆ ಮೌಲ್ಯಗಳು ಸಾಮಾನ್ಯವಾಗಿ ಉತ್ತಮ ಪ್ರತಿಲೇಖನವನ್ನು ಸೂಚಿಸುತ್ತವೆ.

ಕಾರ್ಯಕ್ಷಮತೆಯು ಭಾಷೆಗಳಾದ್ಯಂತ ವ್ಯಾಪಕವಾಗಿ ಬದಲಾಗುತ್ತದೆ. ಮಾದರಿ ಕಾರ್ಡ್ ಈ ಬದಲಾವಣೆಯನ್ನು ಅಸಮಾನ ಫೈನ್-ಟ್ಯೂನಿಂಗ್ ಡೇಟಾಗೆ ಮುಕ್ತವಾಗಿ ಲಿಂಕ್ ಮಾಡುತ್ತದೆ.

ಅರ್ಧ-ನಿಖರ (half-precision) ಪರಿವರ್ತನೆಯ ನಂತರ ಬಿಡುಗಡೆಯಾದ ಮಾದರಿಯು ಸುಮಾರು 900 ಮೆಗಾಬೈಟ್‌ಗಳಷ್ಟಿದೆ. ಪ್ರಾಯೋಗಿಕ ನಿಯೋಜನೆಗೆ ಇನ್ನೂ ಸೂಕ್ತವಾದ ಕಂಪ್ಯೂಟಿಂಗ್ ಹಾರ್ಡ್‌ವೇರ್ ಅಗತ್ಯವಿದೆ.

ವ್ಯಾಪ್ತಿಯು ಸಮಾನ ಗುಣಮಟ್ಟವಲ್ಲ

ಮಾದರಿಯಲ್ಲಿ ಕಂಡುಬರುವ ಭಾಷೆಯು ಪ್ರತಿಯೊಂದು ಉಚ್ಚಾರಣೆ, ಡೊಮೇನ್ ಅಥವಾ ಗದ್ದಲದ ಸೆಟ್ಟಿಂಗ್‌ಗೆ ವಿಶ್ವಾಸಾರ್ಹ ಪ್ರತಿಲೇಖನವನ್ನು ಖಾತರಿಪಡಿಸುವುದಿಲ್ಲ.

ಸಾರ್ವಜನಿಕ ಮೌಲ್ಯ ಮತ್ತು ಸುರಕ್ಷತೆಗಳು

ಉತ್ತಮ ಸ್ಥಳೀಯ-ಭಾಷೆಯ ಗುರುತಿಸುವಿಕೆಯು ಆರೋಗ್ಯ, ಶಿಕ್ಷಣ, ಪ್ರವೇಶಸಾಧ್ಯತೆ ಮತ್ತು ನಾಗರಿಕ ಸೇವೆಗಳನ್ನು ಬೆಂಬಲಿಸುತ್ತದೆ. ಇದು ಸ್ವಾಮ್ಯದ ಮಾದರಿಗಳ ಮೇಲಿನ ಅವಲಂಬನೆಯನ್ನೂ ಕಡಿಮೆ ಮಾಡಬಹುದು.

ತೆರೆದ ತೂಕಗಳು (Open weights) ಪರೀಕ್ಷೆ ಮತ್ತು ರೂಪಾಂತರವನ್ನು ಸಕ್ರಿಯಗೊಳಿಸುತ್ತವೆ. ಪ್ರವೇಶ ಪರಿಸ್ಥಿತಿಗಳು, ಕಂಪ್ಯೂಟ್ ಅಗತ್ಯಗಳು ಮತ್ತು ಪರವಾನಗಿಯು ಇನ್ನೂ ಪ್ರಾಯೋಗಿಕ ಮುಕ್ತತೆಯನ್ನು ರೂಪಿಸುತ್ತವೆ.

ಮಾತಿನ ಡೇಟಾವು ಗುರುತು, ಸ್ಥಳ ಮತ್ತು ಸೂಕ್ಷ್ಮ ಮಾಹಿತಿಯನ್ನು ಬಹಿರಂಗಪಡಿಸಬಹುದು. ಆದ್ದರಿಂದ ಸಂಗ್ರಹಣೆ ಮತ್ತು ಮರುಬಳಕೆಗೆ ಅರ್ಥಪೂರ್ಣ ಸಮ್ಮತಿ ಮತ್ತು ಭದ್ರತೆಯ ಅಗತ್ಯವಿದೆ.

ನಿಯೋಜನೆಯು ಭಾಷಾವಾರು ದೋಷದ ದರಗಳು ಮತ್ತು ವಿಫಲ ಪ್ರಕರಣಗಳನ್ನು ಪ್ರಕಟಿಸಬೇಕು. ಕಾನೂನು, ವೈದ್ಯಕೀಯ ಮತ್ತು ಕಲ್ಯಾಣ ನಿರ್ಧಾರಗಳಿಗೆ ಮಾನವ ವಿಮರ್ಶೆ ಇನ್ನೂ ಅಗತ್ಯವಾಗಿದೆ.

ಉಚ್ಚಾರಣೆ ಮಾನದಂಡಗಳು ಮತ್ತು ಡೇಟಾಸೆಟ್ ತಿದ್ದುಪಡಿಯಲ್ಲಿ ಸಮುದಾಯಗಳು ಭಾಗವಹಿಸಬೇಕು. ಭಾಷಾ ಸೇರ್ಪಡೆಯು ಕೇವಲ ತಾಂತ್ರಿಕ ಮಾನದಂಡವಲ್ಲ.

ಅದನ್ನು ಎಲ್ಲಿ ಬಳಸಲಾಗುತ್ತದೆಯೋ ಅಲ್ಲಿ ಪರೀಕ್ಷಿಸಿ

ಶ್ರವಾಣಿಯು ಒಂದು ಅಮೂಲ್ಯವಾದ ಅಡಿಪಾಯವಾಗಿದೆ. ನೈಜ-ಪ್ರಪಂಚದ ಲೆಕ್ಕಪರಿಶೋಧನೆಗಳು ಉಪಭಾಷೆಗಳು, ಗದ್ದಲ, ಕೋಡ್-ಸ್ವಿಚಿಂಗ್ ಮತ್ತು ಪರಿಣಾಮದ ದೋಷಗಳನ್ನು ಪರೀಕ್ಷಿಸಬೇಕು.

ತೀರ್ಮಾನ

ಈ ಬಿಡುಗಡೆಯು ಭಾರತದ ಭಾಷಣ-ತಂತ್ರಜ್ಞಾನದ ಸಾಮಾನ್ಯ ವ್ಯವಸ್ಥೆಯನ್ನು ವಿಸ್ತರಿಸುತ್ತದೆ. ಪಾರದರ್ಶಕ ಮೌಲ್ಯಮಾಪನ ಮತ್ತು ಸಮುದಾಯ-ನೇತೃತ್ವದ ಸುಧಾರಣೆಯ ಮೂಲಕ ಇದರ ಸಾಮಾಜಿಕ ಮೌಲ್ಯವು ಬೆಳೆಯುತ್ತದೆ.

Sources

Sign in Today’s news
Current affairs Daily news Daily quiz News Blitz Shorts Economic Survey 2025-26 Subjects
Polity Economy Geography Environment History Science & Tech Intl. Relations Internal Security Art & Culture Social Issues
All subjects Exam info UPSC Syllabus Prelims syllabus Mains syllabus Exam pattern Eligibility & attempts OBC & EWS checker Resources Free downloads Booklist 2026 Previous year papers Video notes YouTube channel