Hugging Face a lansat inițiativa 'Data Is Better Together' în colaborare cu Argilla, un pas important spre îmbunătățirea calității seturilor de date în comunitatea open-source de învățare automată (ML). Această inițiativă a atras rapid peste 385 de contributori, rezultând lansarea cu succes a setului de date DIBT/10k_prompts_ranked, destinat să sprijine construirea de modele avansate de ML.
Detalii Cheie
- Obiectivul principal este de a crea un set de date cu 10.000 de prompturi, combinând contribuții sintetice și generate de oameni pentru a rafina sarcinile de clasificare a prompturilor și a îmbunătăți generarea de date sintetice.
- Setul de date DIBT/10k_prompts_ranked este deja utilizat în dezvoltarea de noi modele, cum ar fi SPIN.
- Pentru a răspunde diferențelor lingvistice, inițiativa a demarat Proiectul de Evaluare Multilingvă a Prompturilor, concentrându-se pe traducerea a 500 de prompturi de înaltă calitate în mai multe limbi, inclusiv olandeză, rusă și spaniolă.
- Ca parte a proiectului, au fost create diverse instrumente și ghiduri pentru comunitate pentru a sprijini contributorii în construirea propriilor seturi de date specifice domeniului.
- Obiectivul general este de a aborda inegalitățile existente în reprezentarea seturilor de date pe diverse limbi, domenii și sarcini în peisajul open-source.
Prin promovarea unui mediu colaborativ, Hugging Face își propune nu doar să îmbunătățească calitatea seturilor de date, ci și să asigure o reprezentare diversificată, esențială pentru dezvoltarea de modele de ML corecte și de încredere. Odată cu lansarea primului set de date și implicarea continuă a comunității, această inițiativă reprezintă un pas semnificativ către un ecosistem open-source de ML incluziv și eficient.





