Poziv na Seminar – Corpus of Italian and Serbian Public Discourse (CISPD): Koncept, metodologija i perspektive novog dvojezičnog resursa

Posle letnje pauze Vas pozivamo na Seminar Društva za jezičke resurse i tehnologije koji će se održati u četvrtak, 15. oktobra 2026. godine od 18h, na Rudarsko-geološkom fakultetu (Đušina 7), u svečanoj sali.

Biće nam čast da čujemo izlaganje dr Jovane D. Bazić sa Filološko-umetničkog fakulteta Univerziteta u Kragujevcu na temu:
Corpus of Italian and Serbian Public Discourse (CISPD): Koncept, metodologija i perspektive novog dvojezičnog resursa.

Sažetak:

Corpus of Italian and Serbian Public Discourse (CISPD) predstavlja novi dvojezični uporedni (comparable) korpus italijanskog i srpskog jezika koji prevazilazi nedostatak postojećih jednojezičnih i književnih resursa. Korpus je inicijalno uobličen u okviru doktorske disertacije o pragmatičkim strategijama ograđivanja u javnom diskursu (Bazić, 2025), ali je koncipiran kao trajan, metodološki ujednačen i višenamenski resurs za kontrastivna, sociolingvistička i primenjena istraživanja, kao i za razvoj alata u oblasti jezičkih tehnologija. Resurs je planiran u metodološkom okviru zasnovanom na primeni jednakih kriterijuma selekcije građe iz savremenog, neprevedenog materijala nastalog od 2023. do 2024. godine, uz jasno definisan cilj da se kontinuiranim skupljanjem teksta dostigne obim od 1.000.000 reči.

Ključna inovativnost i metodološka vrednost korpusa ogleda se u njegovoj dvostrukoj strukturi, odnosno ravnomernom i ravnopravnom obuhvatanju i pisanog i govornog modaliteta javnog diskursa u oba jezika. Pisani deo obuhvata pažljivo odabrane i prečišćene tekstove iz vodećih štampanih i onlajn medija obe zemlje (politika, društvo, kultura, nauka), dok govorni deo donosi 12 sati transkribovanog audio-video materijala (televizijske debate, intervjui i podkasti), transkribovanog modelom Whisper uz obaveznu autorovu ručnu verifikaciju. U skladu sa FAIR principima, planirano je da CISPD po završetku izrade bude trajno i otvoreno dostupan akademskoj zajednici kroz.txt fajlove i struktuirani anotirani set podataka (.csv/.tsv) kompatibilan sa savremenim lingvističkim alatima (AntConc, NoSketchEngine, Python, R), čime se postavlja pouzdana baza za buduća dvojezična istraživanja.

Коментари су затворени.