Proje Vaani

Vaani Projesi: Shaip'in Hindistan İçin Çok Dilli Yapay Zeka Şekillendirmedeki Rolü

Hindistan gibi kültürel açıdan çeşitlilik ve dil zenginliği bakımından zengin bir ülkede, kapsayıcı yapay zekâ oluşturmak, temsili ve yüksek kaliteli veri kümeleri toplamakla başlar. Bu, ARTPARK , IISc Bengaluru ve Google liderliğindeki büyük ölçekli, açık kaynaklı bir girişim olan Vaani Projesi'nin ardındaki vizyondur ve her Hint diline ve lehçesine ses vermeyi amaçlamaktadır.

İddialı hedef ne mi? Hindistan'ın 773 bölgesinden 1 milyon kişiden 150,000 saatten fazla konuşma kaydı ve 15,000 saatten fazla transkripsiyon toplamak.

Bu ulusal misyonun kilit tedarikçilerinden biri olarak Shaip , kendiliğinden oluşan konuşma verilerinin derlenmesi, transkripsiyonu ve meta veri toplanmasında çok önemli bir rol oynayarak, gerçek Hindistan'ı gerçekten temsil eden eşitlikçi ses teknolojilerinin temelini attı.

Project Vaani'nin Arkasındaki Vizyon

Vaani Projesi, Hindistan'daki en büyük çok modlu, çok dilli, açık kaynaklı veri setini oluşturarak yapay zekanın erişilebilirliğindeki açığı kapatmayı amaçlamaktadır . Bu veriler, yerel Hint dillerinde doğru konuşma tanıma, çeviri ve üretken yapay zeka sistemleri geliştirmek için temel teşkil etmektedir; bu dillerin birçoğu küresel teknoloji ekosistemlerinde yeterince temsil edilmemektedir.

Uzun vadeli vizyonumuz, şu alanlarda etkili uygulamalara güç sağlamaktır:

Shaip, Project Vaani için Hindistan'ın En Büyük Açık Kaynaklı Konuşma Veri Kümesinin Oluşturulmasına Nasıl Yardımcı Oldu

Shaip'e 8,000 saatlik kendiliğinden konuşma kaydı ve 800 saatlik manuel olarak doğrulanmış transkripsiyonun toplanması görevi verildi . Sorumluluklarımız konuşmacıların sisteme entegrasyonu, ses kaydı, meta veri etiketleme, transkripsiyon koordinasyonu ve kalite kontrolünü kapsıyordu.

8,000 saatlik kendiliğinden kaydedilmiş ses verisi

En fazla 800 saat içerisinde size döneceğiz. yüksek kaliteli manuel transkripsiyonların

Her bölgeden, farklı yaş gruplarını, cinsiyetleri ve lehçeleri temsil eden 400'den fazla yerli konuşmacıdan alınan kayıtlar .

80 ilçe kapsanıyor

Görüntü tabanlı yönlendirme , doğal ve bağlam odaklı konuşmayı sağlar.

Yaklaşımımızı benzersiz kılan şey şudur:

İlçe düzeyinde çeşitlilik

İlçe Düzeyinde Çeşitlilik

Bihar, Uttar Pradesh, Karnataka, Batı Bengal ve Maharashtra gibi eyaletlere yayılmış 80 ilçeden kayıtlar aldık. Her ilçe 100 saatlik ses verisi sağladı ve bölgesel dengeyi sağladı. Ana akım AI veri kümelerinde sıklıkla göz ardı edilen bölgesel aksanların ve lehçelerin temsilini sağlayarak ana dili konuşanlarla etkileşime girdik.

Dilsel ve demografik temsil

Dilsel ve Demografik Temsil

Bihar, Uttar Pradesh, Karnataka, Batı Bengal ve Maharashtra gibi eyaletlere yayılmış 80 ilçeden kayıtlar aldık. Her ilçe 100 saatlik ses verisi sağladı ve bölgesel dengeyi sağladı. Ana akım AI veri kümelerinde sıklıkla göz ardı edilen bölgesel aksanların ve lehçelerin temsilini sağlayarak ana dili konuşanlarla etkileşime girdik.

Görüntüyle İstemli Konuşma

Spontan ve doğal kelime dağarcığını canlandırmak için katılımcılara seans başına 45-90 resim gösterildi ve bunları tanımlamaları istendi. Katılımcılar, kültürel sembollerden günlük nesnelere kadar çeşitli resimler kullanarak kendi ana dillerinde doğal, spontan tepkiler uyandırmaya teşvik edildi. Bu, kayıtların gerçek dünya, bağlamsal konuşmayı yansıtmasını sağladı; bu da gelişmiş NLP sistemlerini eğitmek için olmazsa olmazdır.

Yüksek kaliteli transkripsiyon standartları

Yüksek Kaliteli Transkripsiyon Standartları

Konuşma verilerinin yalnızca %10'u yazıya geçirildi; bu da 800 saate denk geliyor. Yazıya geçirmeler, konuşmacının 20-50 km yarıçapındaki yerel dilbilimciler tarafından gerçekleştirildi ve lehçeler ve nüanslarla aşinalık sağlandı. İkinci katman kontrolü, %5'ten az kelime hatası oranı (WER) sağladı.

Sıkı Kalite Güvencesi

Ses verilerinin yüksek bir çıtayı karşılaması gerekiyordu: arka plan gürültüsü, yankı, telefon titreşimi veya bozulma yoktu. Ses sessiz, yankısız ortamlarda kaydedildi. Dosyalar, konuşma netliği, gürültü seviyeleri, meta veri doğruluğu ve konuşmacı doğrulaması için yönergeleri karşılamak üzere titiz bir incelemeden geçti. Meta veri etiketlemesi tüm dosyalarda doğru olmalıydı ve tüm kayıtlar konuşmacı ve konum hizalaması açısından kontrol edildi.

Çözdüğümüz Zorluklar

Başarımız titiz planlama, teknoloji odaklı doğrulama ve her bölgenin kültürel nüanslarını anlayan yerel ekiplerle yapılan ortaklıklara dayanıyor.

Etki ve Uygulamalar

Shaip'in katkısı yalnızca Proje Vaani'nin ilerlemesini hızlandırmakla kalmadı, aynı zamanda Hindistan'da kapsayıcı AI için temelleri de attı. Düzenlenen konuşma veri seti halihazırda şu amaçlar için AI modelleri oluşturmak ve ince ayar yapmak için kullanılıyor:

  • Yerel sesli asistanlar
  • Bölgesel çeviri motorları
  • Görme engelliler için erişilebilir iletişim araçları
  • Kırsal kesimdeki öğrenciler için yapay zeka destekli edtech platformları
  • Kırsal tele tıp
  • Ses tabanlı vatandaş hizmetleri
  • Gerçek zamanlı çeviri ve transkripsiyon

Sonuç

Vaani Projesi, kapsayıcı ve erişilebilir yapay zekâya doğru atılmış cesur bir adımdır ve Shaip, bu projede temel bir rol oynamaktan onur duyuyor. Shaip'in Vaani Projesi üzerindeki çalışmaları, çeşitliliğe ve temsile dayalı etik ve kapsayıcı yapay zekâ sistemleri oluşturma taahhüdümüzü yeniden teyit ediyor. 8,000 saatten fazla konuşma kaydı toplanmış ve 800 saatlik transkript edilmiş olmasıyla, Hindistan'ın en vizyoner dijital kapsayıcılık projelerinden birinde yer almaktan gurur duyuyoruz.

Project Vaani, 150,000+ saatlik veriye ulaşma hedefine doğru ilerlerken, her Hintliye hitap eden ve her Hintli için geçerli olan yapay zeka inovasyonunun bir sonraki sınırını desteklemeye hazırız.

Gerçek dünyayı anlayan yapay zekâ geliştirmek için bizimle ortaklık kurmak ister misiniz? www.shaip.com

Bu makaleyi beğendiniz mi? Daha fazla güncelleme için Shaip'i LinkedIn'de takip edin.

sosyal paylaşım