Hugging Face, în colaborare cu Argilla, a anunțat inițiativa Data Is Better Together (DIBT), menită să transforme modul în care sunt create seturile de date pentru comunitatea multilingvă de machine learning. Această inițiativă include lansarea Proiectului de Evaluare a Prompturilor Multilingve (MPEP), o inițiativă care răspunde deficitului critic de seturi de date multilingve.
Dezvoltări cheie
- Inițiativa DIBT a început cu publicarea unui set de date ce conține 10.000 de prompturi clasificate. Această lansare a atras participarea a peste 385 de colaboratori în câteva zile.
- MPEP își propune să creeze un clasament pentru evaluarea prompturilor din mai multe limbi. Pentru a demara proiectul, 500 de prompturi de înaltă calitate au fost deja traduse în limbi precum olandeză, rusă și spaniolă.
- Viitoarele eforturi ale comunității se vor concentra pe dezvoltarea unor seturi de date specifice domeniului, permițând inginerilor și experților din diverse domenii să colaboreze eficient pe resurse de date relevante.
- Această inițiativă evidențiază inegalitățile semnificative în reprezentarea seturilor de date în diferite limbi, domenii și sarcini, subliniind necesitatea unor benchmark-uri detaliate.
- Implicarea comunității va continua prin canale Discord, unde colaboratorii pot împărtăși seturi de date, rezultate și pot oferi îndrumări pentru construirea seturilor de date.
Inițiativa DIBT reprezintă un pas strategic pentru a reduce lacunele în disponibilitatea seturilor de date multilingve, în timp ce promovează colaborarea comunității. Pe măsură ce nevoia de seturi de date diverse crește, această inițiativă are potențialul de a juca un rol crucial în conturarea viitorului machine learning-ului open-source.





