fake news data aggregation for Amharic
# የአማርኛ NLP የመረጃ ስብስብ ቁልፍ ግንዛቤዎች
**ለመረጃዎ ግንዛቤን ለማግኘት እና ለሞዴል ስልጠና ለመጠቀም የሚረዳ መመሪያ።**
---
## 1. የመረጃ ስብስብ አስተዋጽኦዎች (ምንድን ነው?)
### 1.1 ምንጭ እና አመጣጥ
**መረጃው ከየት ተገኘ?**
- የዜና ማሰራጫዎች
- ማህበራዊ ሚዲያ
- ሥነ ጽሑፍ
- ሃይማኖታዊ ጽሑፎች
### 1.2 ይዘት እና የትኩረት መስክ ትንተና
**ምን አይነት ርዕሰ ጉዳዮችን ይሸፍናል?**
ይህ ሊኖር የሚችል የትኩረት መስክ ዝንባሌን ያሳያል።
### 1.3 የመረጃ እና የማብራሪያ ጥራት
- የፊደል ግድፈቶችን እና ስህተቶችን ያረጋግጡ።
- ምድብ ላለው መረጃ በአማራሪዎች መካከል ያለውን ስምምነት (IAA) ይለኩ።
---
## 2. ገላጭ ስታቲስቲክስ (ምን ያህል ነው?)
### 2.1 የኮርፐስ (የጽሑፍ ክምችት) ደረጃ ስታቲስቲክስ
- የጠቅላላ ቶክኖች ብዛት
- የቃላት ብዛት
- የቃላት ብዝሃነት ጥምርታ (TTR)
### 2.2 የአረፍተ ነገር/የሰነድ ደረጃ
- የርዝመት ስርጭት (ዝቅተኛ፣ ከፍተኛ፣ አማካይ)
- ለmax_sequence_length በጣም አስፈላጊ ነው።
### 2.3 ከምድብ-ተኮር ስታቲስቲክስ
- የምደባ ስራዎች ላይ የክፍሎች አለመመጣጠንን ለመለየት ይረዳል።
### 2.4 የኤን-ግራም (N-gram) ትንተና
- ተደጋጋሚ ሀረጎችን ለማግኘት የጋራ ዩኒግራም፣ ባይግራም እና ትራይግራም ድግግሞሽ።
---
## 3. የመረጃዎ አስተዋጽኦ ለሞዴል ስልጠና (ታዲያ ምን?)
**የመረጃ ግንዛቤዎን በቀጥታ ከሞዴል ማሰልጠኛ ስልቶች ጋር ያገናኙ።**
| ከትንተናው የተገኘ ግንዛቤ | በሞዴል ስልጠና ላይ ያለው ተጽዕኖ |
|-------------------------|------------------------------|
| የተለያዩ የመረጃ ምንጮች | የሞዴሉን ሁሉን አቀፍ ብቃት ያሻሽላል። |
| የአረፍተ ነገር ርዝመት ስርጭት | ውጤታማ የሃይፐር-ፓራሜትር ማስተካከያ (ለምሳሌ max_length) ለማድረግ ያግዛል። |
| የክፍሎች አለመመጣጠን መለየት | እንደ ክብደት የተሰጣቸው የኪሳራ ፈንክሽኖች ያሉ ቴክኒኮችን ለመጠቀም ያነሳሳል። |
| ንፁህ እና ጥራት ያለው መረጃ | ከስህተት ይልቅ ትክክለኛ የቋንቋ ዘይቤዎችን የሚማር ጠንካራ ሞዴል ይፈጥራል። |
---
**ይህ ገጽ በReact, Tailwind CSS, እና shadcn/ui የተሰራ ነው።**