روشی نو در تحلیل داده های کلان به ویژه گزارش های خبری
حسن بشیر
«تحلیل گفتمان محاسباتی» (Computational Discourse Analysis)
روشهای تحلیل گفتمان متنوع و گوناگون هستند. یکی از این روشها روش تحلیل گفتمان محاسباتی است.
تحلیل گفتمان محاسباتی رویکردی میانرشتهای در زبانشناسی، علوم رایانه و مطالعات اجتماعی است که میکوشد الگوهای گفتمانی را با روشهای خودکار یا نیمهخودکار در پیکرههای متنی شناسایی و تفسیر کند.
مقدمه و توضیح روش
تحلیل گفتمان محاسباتی (Computational Discourse Analysis) یک رویکرد میانرشتهای نوظهور است که از تلفیق زبانشناسی محاسباتی، پردازش زبان طبیعی (NLP) و تحلیل گفتمان (بهویژه تحلیل گفتمان انتقادی و ساختارگرا) شکل گرفته است.
هدف روش
هدف این روششناسی، شناسایی، استخراج و تحلیل الگوهای معنایی، بلاغی، موضعگیریها و ساختارهای ایدئولوژیک در پیکرههای متنی بزرگ مقیاس با استفاده از الگوریتمهای رایانهای است (Baker, 2006). بر خلاف روشهای سنتی تحلیل گفتمان کیفی که به دلیل محدودیتهای شناختی انسان تنها بر روی نمونههای محدود متنی تمرکز دارند، تحلیل گفتمان محاسباتی به پژوهشگر اجازه میدهد تا فرضیههای نظری گفتمان را در مقیاسهای کلان (Big Data) و به شیوهای نظاممند و تکرارپذیر آزمون کند (Biber et al., 1998; Jurafsky & Martin, 2024).
مراحل اجرای روش
در این روش، مراحل زیر به صورت فرایندی و چند مرحله ای باید صورت گیرند.
- ساخت و پیشپردازش پیکره با گرد آوری متون:
در این مرحله، برای گردآوری متون، متون متناسب با پرسش پژوهش (با توجه به مسئله و سوالات پژوهش) گردآوری شده و فرادادههای مرتبط با موضوع و مسئله مورد پژوهش (مانند تاریخ انتشار، نویسنده، ژانر و منبع) ثبت میشوند.
سپس متون تحت فرآیندهایی نظیر پاکسازی، توکنسازی (Tokenization)، ریشهیابی (Lemmatization) و حذف نویز قرار میگیرند (Manning et al., 2008).
- آماده سازی متون برای تحلیل:
سپس با ابزارهای پردازش زبان طبیعی مانند قطعهبندی، برچسبگذاری نقش دستوری، ریشهیابی، تحلیل وابستگی نحوی، تشخیص موجودیتهای نامدار و حل ارجاع، برای تحلیل آماده میگردد.
برای این آماده سازی این مراحل باید انجام گیرند
پردازش زبانی پایه (Linguistic Annotation): با استفاده از کتابخانههای پیشرفته NLP نظیر “spaCy“ یا “Stanza“، ویژگیهای دستوری متن استخراج میشود.
این امر شامل برچسبگذاری نقشهای دستوری (POS Tagging)، تحلیل وابستگی نحوی (Dependency Parsing) و تشخیص موجودیتهای نامدار (NER) است.
در مطالعات پیشرفتهتر، حل ارجاع و هممرجعی (Coreference Resolution) برای ردیابی دقیق کنشگران در طول متن اعمال میشود (Jurafsky & Martin, 2024).
- بررسی ویژگی های گفتمانی با تحلیل ساختار گفتمانی و بلاغی (Discourse & Rhetorical Analysis):
در گام بعد، پژوهشگر به بررسی ویژگیهای گفتمانی مانند انسجام، پیوستگی، روابط بلاغی، موضعگیری، چارچوببندی، عاملیت، استدلال و بازنمایی کنشگران اجتماعی میپردازد. برای این منظور میتوان از روشهایی مانند مدلسازی موضوعی، تحلیل فراوانی واژگانی، همآیی، شبکههای واژگانی، طبقهبندی نظارتشده و چارچوبهایی مانند: نظریه ساختار بلاغی/بلاغت (Rhetorical Structure Theory) (RST) بهره گرفت.
در این مرحله کشف روابط منطقی میان گزارهها (مانند تقابل، علت، نتیجه و توضیح) با استفاده از چارچوبهای ساختاری مانند نظریه ساختار بلاغی (Rhetorical Structure Theory – RST) انجام میشود (Mann & Thompson, 1988).
این تحلیلها به بازنمایی انسجام متنی و شیوه چینش استدلالها کمک میکنند.
- مدلسازی معنایی و استخراج الگوها (Semantic Modeling & Text Mining):
روشهای محاسباتی نظیر مدلسازی موضوعی (Topic Modeling – LDA)، تحلیل همآیی واژگان (Collocation Analysis)، بُردارهای تعبیه واژه (Word Embeddings) و ترنسفورمرهای زبانی بزرگ (LLMs) برای کشف چارچوببندیها (Framing)، موضعگیریها (Stance Detection) و احساسات حاکم بر گفتمان به کار گرفته میشوند (Blei et al., 2003; Devlin et al., 2019).
- اعتبارسنجی و تفسیر کیفی (Validation & Qualitative Interpretation):
یافتههای محاسباتی بدون تفسیر نظری فاقد ارزش گفتمانی هستند. بنابراین، نتایج آماری و الگوریتمی باید از طریق ارزیابی خطای مدل، پایایی بین کدگذاران (Inter-coder Reliability) و در نهایت، خوانش کیفی دقیق و بافتمحور (Close Reading) تفسیر و تایید شوند (Baker, 2006).
ویژگی های این روش
ویژگی مهم این رویکرد آن است که امکان تحلیل حجم بالای دادههای متنی را فراهم میکند و برای مطالعهی گفتمان در رسانهها، سیاست، شبکههای اجتماعی و متون تاریخی بسیار سودمند است. به عنوان مثال، تحلیل گزارش های خبری در مورد جنگ آمریکا و اسرائیل بر علیه جمهوری اسلامی ایران، این روش می تواند بسیار مفید باشد.
با این حال، خروجی محاسباتی بهتنهایی جایگزین تفسیر کیفی نمیشود و باید در کنار تحلیل نظری و بافتی به کار رود. بنابراین، تحلیل گفتمان محاسباتی را میتوان تلفیقی از دقت محاسباتی و تفسیر انتقادی متن دانست که به پژوهشگر کمک میکند الگوهای پنهان و تکرارشونده در گفتمان را با روشی نظاممند آشکار سازد.
چالشها و ملاحظات روششناختی
یکی از چالشهای بنیادین در تحلیل گفتمان محاسباتی، انتقال این روش به زبانهایی غیر از انگلیسی (مانند زبان فارسی و عربی و امثالهم) است. ویژگیهای صرفی و نحوی منحصربهفرد، مسائل مربوط به نیمفاصله، متون محاورهای و نبود پیکرههای گفتمانی استاندارد برچسبخورده در زبانهای کممنبع، نیازمند بومیسازی ابزارها و فرآیندهای مربوطبه تنظیم های دقیق بر روی دادههای محلی است.
افزون بر این، پژوهشگران باید هوشیار باشند که تقلیل تحلیل گفتمان به شاخصهای صرفاً آماری و بسامدی، ممکن است پویاییهای قدرت و لایههای پنهان ایدئولوژیک متن را نادیده بگیرد؛ از این رو تکیه بر رویکردهای ترکیبی (Mixed Methods) الزامی است (Baker, 2006).
در حقیقت این روش نیازمند استفاده کردن از روشهای دیگر تحلیل گفتمان مانند روش هالیدی، فرکلاف و لاکلاو و موفه برای تکمیل فرایند علمی تحلیل است.
منابع
Baker, P. (2006). Using corpora in discourse analysis. Continuum.
Biber, D., Conrad, S., & Reppen, R. (1998). Corpus linguistics: Investigating language structure and use. Cambridge University Press.
Blei, D. M., Ng, A. Y., & Jordan, M. I. (2003). Latent Dirichlet allocation. Journal of Machine Learning Research, 3(Jan), 993-1022.
Jurafsky, D., & Martin, J. H. (2024). Speech and language processing: An introduction to natural language processing, computational linguistics, and speech recognition (3rd ed. draft). Prentice Hall.
Mann, W. C., & Thompson, S. A. (1988). Rhetorical Structure Theory: Toward a functional theory of text organization. Text-Interdisciplinary Journal for the Study of Discourse, 8(3), 243-281.
Manning, C. D., Raghavan, P., & Schütze, H. (2008). Introduction to information retrieval. Cambridge University Press.