Science & Technology

ಶ್ರವಾಣಿ 1.0: 65 ಭಾರತೀಯ ಭಾಷೆಗಳಿಗೆ ಮುಕ್ತ ಧ್ವನಿ ಮಾದರಿ

ಶ್ರವಾಣಿ 1.0: 65 ಭಾರತೀಯ ಭಾಷೆಗಳಿಗೆ ಮುಕ್ತ ಧ್ವನಿ ಮಾದರಿ

ಸುದ್ದಿಯಲ್ಲಿ ಏಕೆ?

ಸಂಶೋಧಕರು 65 ಭಾರತೀಯ ಭಾಷೆಗಳು ಮತ್ತು ಉಪಭಾಷೆಗಳನ್ನು ಒಳಗೊಂಡಿರುವ ಓಪನ್ ಆಟೋಮ್ಯಾಟಿಕ್ ಸ್ಪೀಚ್ ರೆಕಗ್ನಿಷನ್ (Automatic Speech Recognition) ಮಾದರಿಯಾದ ಶ್ರವಾಣಿ 1.0 (SraVaani 1.0) ಅನ್ನು ಬಿಡುಗಡೆ ಮಾಡಿದ್ದಾರೆ.

ಮಾದರಿಯು ಏನು ಮಾಡುತ್ತದೆ

ಆಟೋಮ್ಯಾಟಿಕ್ ಸ್ಪೀಚ್ ರೆಕಗ್ನಿಷನ್ ಮಾತನಾಡುವ ಆಡಿಯೊವನ್ನು ಪಠ್ಯವಾಗಿ ಪರಿವರ್ತಿಸುತ್ತದೆ. ಭಾರತದ ಬಹುಭಾಷಾ ಮತ್ತು ಕಡಿಮೆ-ಸಂಪನ್ಮೂಲ ಸೆಟ್ಟಿಂಗ್‌ಗಾಗಿ ಶ್ರವಾಣಿಯನ್ನು ವಿನ್ಯಾಸಗೊಳಿಸಲಾಗಿದೆ.

ಸಂಶೋಧನಾ ತಂಡವು ಫಾಸ್ಟ್‌ಕನ್ಫಾರ್ಮರ್ (FastConformer) ಆರ್ಕಿಟೆಕ್ಚರ್ ಮತ್ತು ಹೈಬ್ರಿಡ್ ಡಿಕೋಡಿಂಗ್ ಸಿಸ್ಟಮ್ ಅನ್ನು ಬಳಸಿದೆ. ಮಾದರಿಯು ಸುಮಾರು 430 ಮಿಲಿಯನ್ ನಿಯತಾಂಕಗಳನ್ನು ಒಳಗೊಂಡಿದೆ.

ಪೂರ್ವ-ತರಬೇತಿಯು 105 ಭಾಷೆಗಳಾದ್ಯಂತ 31,255 ಗಂಟೆಗಳ ಲೇಬಲ್ ಮಾಡದ ವಾಣಿ ಭಾಷಣವನ್ನು ಬಳಸಿದೆ. ಫೈನ್-ಟ್ಯೂನಿಂಗ್ 65 ಪ್ರಭೇದಗಳಾದ್ಯಂತ ಸುಮಾರು 31,263 ಗಂಟೆಗಳನ್ನು ಬಳಸಿದೆ.

ಒಂದು ಮಧ್ಯಂತರ ಹಂತವು ಜೋಡಿಯಾದ ಚಿತ್ರಗಳೊಂದಿಗೆ ಭಾಷಣವನ್ನು ಜೋಡಿಸಿತು. ಲಾಕ್ಷಣಿಕ ಪ್ರಾತಿನಿಧ್ಯಗಳನ್ನು ಬಲಪಡಿಸಲು ಸಂಶೋಧಕರು ಇದನ್ನು ಉದ್ದೇಶಿಸಿದ್ದರು.

ಡೇಟಾ ಮತ್ತು ಮೌಲ್ಯಮಾಪನ

ವಾಣಿ ಎಂಬುದು ಇಂಡಿಯನ್ ಇನ್‌ಸ್ಟಿಟ್ಯೂಟ್ ಆಫ್ ಸೈನ್ಸ್ ಮತ್ತು ಆರ್ಟಿಫಿಶಿಯಲ್ ಇಂಟೆಲಿಜೆನ್ಸ್ ಮತ್ತು ರೊಬೊಟಿಕ್ಸ್ ಟೆಕ್ನಾಲಜಿ ಪಾರ್ಕ್‌ನ ಉಪಕ್ರಮವಾಗಿದೆ. ಎರಡನೇ ಸಂಸ್ಥೆಯು ARTPARK ಎಂಬ ಹೆಸರನ್ನು ಬಳಸುತ್ತದೆ. ವಾಣಿಯು ಸ್ಟುಡಿಯೋ ರೆಕಾರ್ಡಿಂಗ್‌ಗಳನ್ನು ಮಾತ್ರ ಅವಲಂಬಿಸುವ ಬದಲು ಜಿಲ್ಲಾ ಮಟ್ಟದ ಭಾಷಣವನ್ನು ಸಂಗ್ರಹಿಸುತ್ತದೆ.

ಪತ್ರಿಕೆಯು ಎಂಟು ಮಾನದಂಡಗಳಾದ್ಯಂತ ಶ್ರವಾಣಿಯನ್ನು ಮೌಲ್ಯಮಾಪನ ಮಾಡಿದೆ. ಇದು ಅನೇಕ ಭಾಷೆ-ಮತ್ತು-ಡೇಟಾಸೆಟ್ ಸಂಯೋಜನೆಗಳಲ್ಲಿ ಬಲವಾದ ಫಲಿತಾಂಶಗಳನ್ನು ವರದಿ ಮಾಡಿದೆ.

ವರ್ಡ್ ಎರರ್ ರೇಟ್ (Word Error Rate) ಉಲ್ಲೇಖ ಪಠ್ಯದ ವಿರುದ್ಧ ಅಳವಡಿಕೆಗಳು, ಅಳಿಸುವಿಕೆಗಳು ಮತ್ತು ಪರ್ಯಾಯಗಳನ್ನು ಅಳೆಯುತ್ತದೆ. ಕಡಿಮೆ ಮೌಲ್ಯಗಳು ಸಾಮಾನ್ಯವಾಗಿ ಉತ್ತಮ ಪ್ರತಿಲೇಖನವನ್ನು ಸೂಚಿಸುತ್ತವೆ.

ಕಾರ್ಯಕ್ಷಮತೆಯು ಭಾಷೆಗಳಾದ್ಯಂತ ವ್ಯಾಪಕವಾಗಿ ಬದಲಾಗುತ್ತದೆ. ಮಾದರಿ ಕಾರ್ಡ್ ಈ ಬದಲಾವಣೆಯನ್ನು ಅಸಮಾನ ಫೈನ್-ಟ್ಯೂನಿಂಗ್ ಡೇಟಾಗೆ ಮುಕ್ತವಾಗಿ ಲಿಂಕ್ ಮಾಡುತ್ತದೆ.

ಅರ್ಧ-ನಿಖರ (half-precision) ಪರಿವರ್ತನೆಯ ನಂತರ ಬಿಡುಗಡೆಯಾದ ಮಾದರಿಯು ಸುಮಾರು 900 ಮೆಗಾಬೈಟ್‌ಗಳಷ್ಟಿದೆ. ಪ್ರಾಯೋಗಿಕ ನಿಯೋಜನೆಗೆ ಇನ್ನೂ ಸೂಕ್ತವಾದ ಕಂಪ್ಯೂಟಿಂಗ್ ಹಾರ್ಡ್‌ವೇರ್ ಅಗತ್ಯವಿದೆ.

ವ್ಯಾಪ್ತಿಯು ಸಮಾನ ಗುಣಮಟ್ಟವಲ್ಲ

ಮಾದರಿಯಲ್ಲಿ ಕಂಡುಬರುವ ಭಾಷೆಯು ಪ್ರತಿಯೊಂದು ಉಚ್ಚಾರಣೆ, ಡೊಮೇನ್ ಅಥವಾ ಗದ್ದಲದ ಸೆಟ್ಟಿಂಗ್‌ಗೆ ವಿಶ್ವಾಸಾರ್ಹ ಪ್ರತಿಲೇಖನವನ್ನು ಖಾತರಿಪಡಿಸುವುದಿಲ್ಲ.

ಸಾರ್ವಜನಿಕ ಮೌಲ್ಯ ಮತ್ತು ಸುರಕ್ಷತೆಗಳು

ಉತ್ತಮ ಸ್ಥಳೀಯ-ಭಾಷೆಯ ಗುರುತಿಸುವಿಕೆಯು ಆರೋಗ್ಯ, ಶಿಕ್ಷಣ, ಪ್ರವೇಶಸಾಧ್ಯತೆ ಮತ್ತು ನಾಗರಿಕ ಸೇವೆಗಳನ್ನು ಬೆಂಬಲಿಸುತ್ತದೆ. ಇದು ಸ್ವಾಮ್ಯದ ಮಾದರಿಗಳ ಮೇಲಿನ ಅವಲಂಬನೆಯನ್ನೂ ಕಡಿಮೆ ಮಾಡಬಹುದು.

ತೆರೆದ ತೂಕಗಳು (Open weights) ಪರೀಕ್ಷೆ ಮತ್ತು ರೂಪಾಂತರವನ್ನು ಸಕ್ರಿಯಗೊಳಿಸುತ್ತವೆ. ಪ್ರವೇಶ ಪರಿಸ್ಥಿತಿಗಳು, ಕಂಪ್ಯೂಟ್ ಅಗತ್ಯಗಳು ಮತ್ತು ಪರವಾನಗಿಯು ಇನ್ನೂ ಪ್ರಾಯೋಗಿಕ ಮುಕ್ತತೆಯನ್ನು ರೂಪಿಸುತ್ತವೆ.

ಮಾತಿನ ಡೇಟಾವು ಗುರುತು, ಸ್ಥಳ ಮತ್ತು ಸೂಕ್ಷ್ಮ ಮಾಹಿತಿಯನ್ನು ಬಹಿರಂಗಪಡಿಸಬಹುದು. ಆದ್ದರಿಂದ ಸಂಗ್ರಹಣೆ ಮತ್ತು ಮರುಬಳಕೆಗೆ ಅರ್ಥಪೂರ್ಣ ಸಮ್ಮತಿ ಮತ್ತು ಭದ್ರತೆಯ ಅಗತ್ಯವಿದೆ.

ನಿಯೋಜನೆಯು ಭಾಷಾವಾರು ದೋಷದ ದರಗಳು ಮತ್ತು ವಿಫಲ ಪ್ರಕರಣಗಳನ್ನು ಪ್ರಕಟಿಸಬೇಕು. ಕಾನೂನು, ವೈದ್ಯಕೀಯ ಮತ್ತು ಕಲ್ಯಾಣ ನಿರ್ಧಾರಗಳಿಗೆ ಮಾನವ ವಿಮರ್ಶೆ ಇನ್ನೂ ಅಗತ್ಯವಾಗಿದೆ.

ಉಚ್ಚಾರಣೆ ಮಾನದಂಡಗಳು ಮತ್ತು ಡೇಟಾಸೆಟ್ ತಿದ್ದುಪಡಿಯಲ್ಲಿ ಸಮುದಾಯಗಳು ಭಾಗವಹಿಸಬೇಕು. ಭಾಷಾ ಸೇರ್ಪಡೆಯು ಕೇವಲ ತಾಂತ್ರಿಕ ಮಾನದಂಡವಲ್ಲ.

ಅದನ್ನು ಎಲ್ಲಿ ಬಳಸಲಾಗುತ್ತದೆಯೋ ಅಲ್ಲಿ ಪರೀಕ್ಷಿಸಿ

ಶ್ರವಾಣಿಯು ಒಂದು ಅಮೂಲ್ಯವಾದ ಅಡಿಪಾಯವಾಗಿದೆ. ನೈಜ-ಪ್ರಪಂಚದ ಲೆಕ್ಕಪರಿಶೋಧನೆಗಳು ಉಪಭಾಷೆಗಳು, ಗದ್ದಲ, ಕೋಡ್-ಸ್ವಿಚಿಂಗ್ ಮತ್ತು ಪರಿಣಾಮದ ದೋಷಗಳನ್ನು ಪರೀಕ್ಷಿಸಬೇಕು.

ತೀರ್ಮಾನ

ಈ ಬಿಡುಗಡೆಯು ಭಾರತದ ಭಾಷಣ-ತಂತ್ರಜ್ಞಾನದ ಸಾಮಾನ್ಯ ವ್ಯವಸ್ಥೆಯನ್ನು ವಿಸ್ತರಿಸುತ್ತದೆ. ಪಾರದರ್ಶಕ ಮೌಲ್ಯಮಾಪನ ಮತ್ತು ಸಮುದಾಯ-ನೇತೃತ್ವದ ಸುಧಾರಣೆಯ ಮೂಲಕ ಇದರ ಸಾಮಾಜಿಕ ಮೌಲ್ಯವು ಬೆಳೆಯುತ್ತದೆ.

Sources

Home Current Affairs 📰 Daily News 🎬 Watch Shorts 📊 Economic Survey 2025-26 Subjects 📚 All Subjects ⚖️ Indian Polity 💹 Economy 🌍 Geography 🌿 Environment 📜 History Exam Info 📋 Syllabus 2026 📝 Prelims Syllabus ✍️ Mains Syllabus ✅ Eligibility Resources 📖 Booklist 📊 Exam Pattern 📄 Previous Year Papers ▶️ YouTube Channel
Sign In