Artykuł w czasopiśmie
Ładowanie...
Miniatura
Licencja

CC-BY-NC-NDCC-BY-NC-ND - Uznanie autorstwa - Użycie niekomercyjne - Bez utworów zależnych

Analiza ilościowa zestawów danych i schematów ich wykorzystania w modelach językowych

Punktacja ministerialna
40
Data publikacji
Abstrakt (PL)

Cel/Teza Rosnąca popularność modeli językowych implikuje wzrost zainteresowania zestawami danych wykorzystywanymi do ich szkolenia. Analiza wpisuje się w nurt badań poświęconych tym zbiorom, koncentrując się na częstotliwości ich wykorzystania oraz schematach użycia przez różne typy modeli językowych. Koncepcja/Metody badań Przeanalizowano 56 762 modele językowe z repozytorium Hugging Face. W ramach analizy zidentyfikowano zestawy danych oraz określono częstość ich wykorzystania przez modele językowe. Zbadano także stopień zróżnicowania wykorzystania danych przez autorów modeli oraz stopień wykorzystania zestawów w różnych kategoriach modeli językowych. Wyniki i wnioski Większość modeli była szkolona na podstawie tylko jednego zestawu danych. Zaobserwowano także, że w kategoriach z mniejszą liczbą modeli występuje większe zróżnicowanie wykorzystywanych do ich szkolenia zestawów. Oryginalność/Wartość poznawcza Analiza ujawnia pewne schematy dotyczące stopnia zróżnicowania wykorzystania zestawów danych w zależności od autora i kategorii modelu językowego.

Abstrakt (EN)

Purpose/Thesis:The growing popularity of language models implies increasing interest in the datasets used for their training. This analysis aligns with the research trend focused on such datasets, concentrating on the frequency of their use and patterns of application across different types of language models. Approach/Methods:A total of 56,762 language models from the Hugging Face repository were analyzed. The study involved identifying the datasets used and determining their frequency of use in model training. It also examined the diversity of dataset usage among model authors and the degree of dataset usage across various language model categories Results and Conclusions: Most models were trained using only a single dataset. It was also observed that categories with fewer models exhibited greater diversity in the datasets used for training. Originality/Value:The analysis reveals certain patterns concerning the degree of diversity in dataset usage, depending on the author and the category of the language model.

Dyscyplina PBN
nauki o komunikacji społecznej i mediach
Inny tytuł

Quantitative Analysis of Datasets and the Patterns of Their Use in Language Models

Czasopismo
Zagadnienia Informacji Naukowej
Tom
63
Zeszyt
1
Strony od-do
93-116
ISSN
0324-8194
eISSN
2392-2648
Licencja otwartego dostępu
Uznanie autorstwa - Użycie niekomercyjne - Bez utworów zależnych