د قضیې مطالعه: د خبرو اترو AI

په ۸ هندي ژبو کې د ASR جوړولو لپاره له ۳۰۰۰ ساعتونو څخه زیات معلومات راټول شوي، ویشل شوي او لیکل شوي دي

خبرې اترې ai

د حکومت موخه دا ده چې د بهشیني پروژې له لارې خپلو اتباعو ته په خپله مورنۍ ژبه انټرنیټ او ډیجیټل خدماتو ته اسانه لاسرسۍ وړ کړي.

BHASHINI، د هند د AI لخوا پرمخ وړل شوي ژبې ژباړې پلیټ فارم، د ډیجیټل هند نوښت یوه حیاتي برخه ده.

د مصنوعي استخباراتو (AI) او د طبیعي ژبې پروسس کولو (NLP) وسیلو چمتو کولو لپاره ډیزاین شوی چې MSMEs، پیل کولو، او خپلواک نوښتګرانو ته، د بهشیني پلیټ فارم د عامه سرچینې په توګه کار کوي. د دې هدف دا دی چې د هند اتباعو ته د دې وړتیا ورکړي چې د دوی په مورنیو ژبو کې د هیواد ډیجیټل نوښتونو سره اړیکه ونیسي.

برسیره پردې، دا موخه په هندي ژبو کې د انټرنیټ منځپانګې شتون د پام وړ پراخول دي. دا په ځانګړې توګه د عامه ګټو برخو لکه حکومتداري او پالیسي، ساینس او ​​​​ټیکنالوژي او داسې نور په نښه کوي. په پایله کې، دا به خلک وهڅوي چې انټرنیټ په خپله ژبه وکاروي، د دوی فعال ګډون ته وده ورکړي.

د حقیقي نړۍ حل

د ډیټا سره د سیمه ایز کولو ځواک خلاصول

هند داسې پلیټ فارم ته اړتیا درلوده چې په هندي ژبو کې ډیجیټل خدمات چمتو کولو لپاره د څو ژبو ډیټاسیټونو او د مصنوعي ذهانت پر بنسټ د ژبې ټیکنالوژۍ حلونو په جوړولو تمرکز وکړي. د دې نوښت د پیل کولو لپاره، د هند د ټیکنالوژۍ انسټیټیوټ، مدراس (IIT مدراس) د شیپ سره ملګرتیا وکړه ترڅو د څو ژبو وینا ماډلونو جوړولو لپاره د هندي ژبې ډیټاسیټونه راټول کړي، برخې کړي او نقل کړي.

ننګونې

د هندي ژبو لپاره د دوی د سپیچ ټیکنالوژۍ وینا سړک نقشه کې د پیرودونکي سره د مرستې لپاره ، ټیم اړتیا درلوده چې د AI ماډل رامینځته کولو لپاره د روزنې ډیټا لوی مقدار ترلاسه کړي ، برخې کړي او لیږد کړي. د پیرودونکي مهمې اړتیاوې دا وې:

د ډاټا ټولګه

  • په 3000 هندي ژبو کې د 8 ساعتونو روزنې ډیټا په هره ژبه کې د 4 ژبو سره ترلاسه کړئ.
  • د هرې ژبې لپاره، عرضه کوونکي به د Extempore Speech او
    د 18-60 کلونو د عمر ګروپونو څخه د خبرو اترو وینا
  • د عمر، جنس، تعلیم او ژبو له مخې د ویناوالو متنوع ترکیب ډاډمن کړئ
  • د مشخصاتو سره سم د ثبت کولو چاپیریال متنوع ترکیب ډاډمن کړئ.
  • هر آډیو ریکارډ باید لږترلږه 16kHz وي مګر په غوره توګه 44kHz

د معلوماتو ویش

  • د 15 ثانیو لپاره د وینا برخې رامینځته کړئ او د هر ورکړل شوي سپیکر لپاره آډیو ملیسیکنډونو ته ټایم سټمپ کړئ ، د غږ ډول (وینا ، ببل ، میوزیک ، شور) ، په خبرو اترو کې ، ویناوې او جملې
  • په پیل او پای کې د 200-400 ملی ثانوي پیډینګ سره د خپل هدف شوي غږ سیګنال لپاره هره برخه جوړه کړئ.
  • د ټولو برخو لپاره، لاندې توکي باید ډک شي لکه د پیل وخت، د پای وخت، د برخې ID، د غږ کچه، د غږ ډول، د ژبې کوډ، د سپیکر ID، او داسې نور.

د معلوماتو لیږد

  • د حروفو او ځانګړو سمبولونو، املا او ګرامر، کیپیټل کولو، مخففاتو، تړونونو، انفرادي خبرې کولو حروفونو، شمیرو، جزاګانو، مخففاتو، ګډوډ، وینا، نا پوهیدلو وینا، غیر هدفي ژبې، غیر هدفي ژبې، او داسې نور په اړه د توضیحاتو لیږد لارښوونې تعقیب کړئ.

د کیفیت معاینه او فیډبیک

  • ټول ریکارډونه د کیفیت ارزونې او اعتبار څخه تیریږي، یوازې تایید شوې وینا باید وړاندې شي

د حل

د خبرو اترو مصنوعي ذهانت په اړه زموږ د ژورې پوهې سره، موږ د مراجعینو سره د متخصص راټولونکو، ژبپوهانو او تشریح کونکو د یوې ډلې سره د معلوماتو راټولولو، ویشلو او لیکلو کې مرسته وکړه ترڅو په 8 هندي ژبو کې د آډیو ډیټاسیټ لوی کارپس جوړ کړو.

د شایپ لپاره د کار ساحه شامله وه مګر محدوده نه وه د آډیو روزنې ډیټا لوی مقدار ترلاسه کول، د آډیو ریکارډونه په څو برخو ویشل، د معلوماتو لیږد کول او د میټاډاټا لرونکي اړونده JSON فایلونه وړاندې کول [سپیکر ID، عمر، جنس، ژبه، لهجه، مورنۍ ژبه، وړتیا، مسلک، ډومین، د فایل بڼه، فریکونسی، چینل، د آډیو ډول، د ویناوالو شمیر، د بهرنیو ژبو شمیر، کارول شوي تنظیم، نری بانډ یا وایډ بانډ آډیو، او نور].

شیپ په پیمانه د 3000 ساعتونو آډیو ډیټا راټول کړل پداسې حال کې چې د پیچلو پروژو لپاره د وینا ټیکنالوژۍ روزنې لپاره اړین کیفیت مطلوب کچې ساتل. د هر ګډونوال څخه د واضح رضایت فورمه اخیستل شوې وه.

1. د ډاټا ټولګه

2. د معلوماتو ویش

  • هغه آډیو معلومات چې راټول شوي وو د ۱۵ ثانیو د وینا په برخو کې نور هم وویشل شول او د هر ورکړل شوي ویناوال، د غږ ډول، نوبت، وینا او په خبرو اترو کې د جملو لپاره په ملی ثانیو کې وخت ټاپه شو.
  • د غږ سیګنال په پیل او پای کې د 200-400 ملی ثانوي پیډینګ سره د خپل هدف شوي غږ سیګنال لپاره هره برخه جوړه کړه.
  • د ټولو برخو لپاره، لاندې توکي موجود وو او ډک شوي لکه د پیل وخت، د پای وخت، د برخې ID، د غږ کچه (لوډ، نورمال، خاموش)، د لومړني غږ ډول (وینا، ببل، موسیقي، شور، اوورلیپ)، د ژبې کوډ سپیکر ID، لیږد او داسې نور.

3. کیفیت چک او فیډبیک

  • ټول ریکارډونه د کیفیت لپاره ارزول شوي او یوازې د 90٪ WER او 90٪ TER سره تایید شوي وینا ریکارډونه وړاندې شوي.
  • د کیفیت چک لیست تعقیب شوی:
    » د برخې اوږدوالی اعظمي 15 ثانیې
    » د ځانګړو ډومینونو څخه لیږد، لکه: هوا، د خبرونو مختلف ډولونه، روغتیا، کرهنه، تعلیم، دندې یا مالیه
    » ټیټ شالید شور
    » هیڅ آډیو کلیپ بند نه دی - هیڅ تحریف نشته
    » د لیږد لپاره د آډیو قطع کول درست کړئ

4. د معلوماتو لیږد

ټولې خبرې شوي ټکي، پشمول د شک، ډک ټکي، غلط پیل، او نور لفظي ټکي، په نقل کې په سمه توګه نیول شوي. موږ د لوی او کوچني حروفو، املا، لوی کولو، لنډیزونو، انقباض، شمیرو، په شاوخوا کې د توضیحاتو لیږد لارښوونې هم تعقیب کړې
ټکي ټکي، مخففونه، بې ځایه وینا، غیر وینا غږونه او نور. سربیره پردې د راټولولو او لیږد لپاره د کار جریان په لاندې ډول دی:

پایلې

د ماهر ژبپوهانو لخوا د لوړ کیفیت آډیو ډیټا به د هند ټیکنالوژۍ انسټیټیوټ - مدراس ته دا وړتیا ورکړي چې په ټاکل شوي وخت کې په 8 هندي ژبو کې د څو ژبو د وینا پیژندنې ماډلونه په سمه توګه روزنه او رامینځته کړي. د وینا پیژندنې ماډلونه د دې لپاره کارول کیدی شي:

  • د ډیجیټل شاملولو لپاره د ژبې خنډ له منځه یوسي ترڅو اتباع په خپله مورنۍ ژبه کې نوښتونو سره وصل کړي.
  • ډیجیټل حکومتداري ته وده ورکوي
  • کتلست په هندي ژبو کې د خدماتو او محصولاتو لپاره د ایکوسیستم جوړولو لپاره
  • د عامه ګټو په ډومینونو کې ډیر ځایی ډیجیټل مینځپانګه ، په ځانګړي توګه حکومتداري او پالیسي
د نرخ نښه

موږ د خبرو اترو په مصنوعي ذهانت کې د شایپ له تخصص څخه متاثره شو. د دوی د پروژې د اجرا کولو عمومي وړتیا د متخصص ژبپوهانو څخه د اړینو روزنیزو معلوماتو د سرچینې کولو، ویشلو، لیکلو او په 8 ژبو کې د سختو وختونو او لارښوونو دننه رسولو څخه؛ پداسې حال کې چې لاهم د کیفیت د منلو وړ معیار ساتل کیږي.

★★★★★
د نرخ نښه

موږ ته ووایاست چې موږ ستاسو د راتلونکي AI نوښت سره څنګه مرسته کولی شو.