Licencja
Analiza ilościowa zestawów danych i schematów ich wykorzystania w modelach językowych
Analiza ilościowa zestawów danych i schematów ich wykorzystania w modelach językowych
ORCID
Abstrakt (PL)
Cel/Teza Rosnąca popularność modeli językowych implikuje wzrost zainteresowania zestawami danych wykorzystywanymi do ich szkolenia. Analiza wpisuje się w nurt badań poświęconych tym zbiorom, koncentrując się na częstotliwości ich wykorzystania oraz schematach użycia przez różne typy modeli językowych. Koncepcja/Metody badań Przeanalizowano 56 762 modele językowe z repozytorium Hugging Face. W ramach analizy zidentyfikowano zestawy danych oraz określono częstość ich wykorzystania przez modele językowe. Zbadano także stopień zróżnicowania wykorzystania danych przez autorów modeli oraz stopień wykorzystania zestawów w różnych kategoriach modeli językowych. Wyniki i wnioski Większość modeli była szkolona na podstawie tylko jednego zestawu danych. Zaobserwowano także, że w kategoriach z mniejszą liczbą modeli występuje większe zróżnicowanie wykorzystywanych do ich szkolenia zestawów. Oryginalność/Wartość poznawcza Analiza ujawnia pewne schematy dotyczące stopnia zróżnicowania wykorzystania zestawów danych w zależności od autora i kategorii modelu językowego.
Abstrakt (EN)
Purpose/Thesis:The growing popularity of language models implies increasing interest in the datasets used for their training. This analysis aligns with the research trend focused on such datasets, concentrating on the frequency of their use and patterns of application across different types of language models. Approach/Methods:A total of 56,762 language models from the Hugging Face repository were analyzed. The study involved identifying the datasets used and determining their frequency of use in model training. It also examined the diversity of dataset usage among model authors and the degree of dataset usage across various language model categories Results and Conclusions: Most models were trained using only a single dataset. It was also observed that categories with fewer models exhibited greater diversity in the datasets used for training. Originality/Value:The analysis reveals certain patterns concerning the degree of diversity in dataset usage, depending on the author and the category of the language model.
Quantitative Analysis of Datasets and the Patterns of Their Use in Language Models