本研究结合基于规则的策略、机器学习和专家辅助,对混合印地语和英语的文本进行标注。该方法在19,000条推文数据上进行测试,准确率达到81%,成本远低于人工标注。该方法可用于危机期间的情绪追踪。
研究文章
本研究结合基于规则的策略、机器学习和专家辅助,对混合印地语和英语的文本进行标注。该方法在19,000条推文数据上进行测试,准确率达到81%,成本远低于人工标注。该方法可用于危机期间的情绪追踪。
在印英混合语(Hinglish,即印地语-英语混合语)等语码混合语言中进行情感标注面临独特的挑战,原因在于其语言复杂性和资源限制。本研究提出一种混合主动学习框架,结合词汇规则、机器学习和迭代式专家反馈,以实现成本效益高且准确率高情感标注。该框架基于情感的心理学理论,包括离散情感理论和认知评价理论,采用双语情感词典(例如,将“gussa”和“rage”映射为“anger”),对复合词进行子词切分(例如,将
拆分为
),并利用主动学习优先处理模糊样本。在包含19,000条与战争和冲突相关的Hinglish推文数据集上进行评估,该框架在准确率达到81%(F分数:0.76)的同时,相比纯人工标注降低了40%的运营成本。词汇规则解决了89%的语码转换歧义问题,而通过迭代优化使准确率从72%逐步提升至81%。该系统的高效性源于将人工工作量限制在数据集的73%,其余部分通过自动化预处理表情符号、话题标签和俚语完成。本研究基于如下假设:将基于词汇规则的方法与主动学习和机器学习相结合,可提高Hinglish文本情感标注的准确性,同时减少人工标注和整体标注工作量。
当两种或多种语言在同一句话或言语中混合使用时,这被称为语码混合语言。这种现象在日常对话中很常见,例如“印地语-英语混合语”(Hinglish)。人类情绪可以通过多种方式被理解,而对一系列情绪化语句进行计算建模,则需要由说出这些句子的人对其进行情感标注。情绪可以在生物学、生理学、心理学等层面上加以理解。根据罗杰·彭罗斯(Roger Penrose)等科学家的观点,我们世界中的许多现象是非计算性的,而斯蒂芬·沃尔夫勒姆(Wolfram)等科学家则认为,一切(所有现象)都可以通过计算方式进行建模1。彭罗斯认为,意识涉及某些过程(可能与大脑内的量子力学有关),这些过程超越了任何逐步执行的算法程序所能实现的范围。他常引用哥德尔不完备性定理来支持这样一个观点:例如,人类的数学洞察力超越了形式系统2。如果意识本身是非计算性的,那么作为意识体验关键组成部分的情绪,也可能包含非计算性的元素。斯蒂芬·沃尔夫勒姆(Stephen Wolfram)因开发Mathematica及在元胞自动机方面的研究而闻名,他提出了"计算等价性原理"。该原理认为,即使是非常复杂的系统,包括宇宙本身及其内部的现象(如情绪),最终都可以用计算规则来描述和建模,即使这些规则本身极为简单,也能产生复杂的行为。但在实际操作中,这并不可行,因此我们需要被称为专家或简单称为标注者的人来进行情绪分析3。
本研究中,我们提出构建计算模型的理念,但该模型将是准计算性质的。本研究在此背景下的目标是以计算形式呈现,但可能无法完美捕捉所有方面,或许会为那些难以或无法完全计算的复杂性留下空间。情感难以通过计算建模,因为它们依赖于主观体验、文化背景以及细微的表达方式,而这些无法通过固定算法完全捕捉。
因此,在使用基于变量的计算方法对人类情绪进行建模时,有必要对人类情绪表达进行标注。此类标注应由具备情绪分析专业知识的专家或标注人员完成¹。理解人类情绪的复杂性并非易事,尤其是在处理混合语言时。此外,由于规模相关的问题,单纯依赖人工手动标注并不可行。近期研究表明,在构建用于此类复杂任务的系统时,持续需要采用“人在回路中”(human-in-the-loop)的方法。因此,采用半自动化的策略最为合适:将较为简单的部分自动化处理,而将需要人类判断细微差别的任务交由标注人员完成,这似乎是开发该领域自然语言系统的最佳途径。
人工标注者当然需要手动完成工作,而在计算时代,这并非当代科学家应有的工作方式。如果标注者(无论是人工、半自动还是全自动)能够智能地识别出话语中所体现的情感类型,而这些话语包含以符号形式表达的多种情感类型,并夹杂俚语、语码混合以及多种模态,则该任务同时具有简单与困难的双重特性。在使用Hinglish(印地语-英语混合语)的话语中进行情感标注的复杂性取决于表达方式的性质。当情感通过熟悉的词汇或表情符号清晰传达时,标注相对直接。然而,当话语涉及多种情感、语码混合或含义模糊的符号表达时,任务难度显著增加。因此,情感标注的难易程度取决于情感表达的直接性。
当前在情绪与情感识别方面的研究方法致力于应对这些挑战,包括情绪的主观性、人类表达中的模糊性、混合语种(如印英混杂语Hinglish)的复杂性,以及人工标注耗时且不一致等问题,这些均与构建计算模型和处理繁琐的标注任务密切相关。近期研究表明,研究者正采用多种方法实现这一目标,包括机器学习、深度学习以及各类混合方法。最新研究显示,为克服上述问题,研究者正在应用多种技术手段,例如机器学习、深度学习和混合模型。
最近的研究表明,研究人员正在采用各种方法,包括机器学习、深度学习3以及混合方法。情感分析这一术语指的是在认为情绪极性可作为理解人类原始情绪标志时所采用的一种分析方法3,4。此类技术的发展有助于识别情绪状态、情感、言语、面部表情以及非语言线索,并已逐步应用于支持实时翻译的系统中2。多模态方法可用于将印式英语(Hinglish)翻译为英语,未来可能有助于使印度电影更易于被偏远地区人群所接受5,6。例如,在印度,英语通常是第二语言。相关研究表明,通过分析印度人使用的混合语码(mix-code language)中每个词汇的表达性或情感强度,已有效提升了英语教学的质量。
在此研究背景下,混合语码语言与翻译相结合的使用已被证明能够提升英语教学的质量。该研究通过分析印度语中的混合语码语言,判断每个词汇的表达性或情感倾向,从而实现这一目标。通过应用深度学习技术训练计算机进行语音解读,此项研究已提高了计算机语音分析的准确性,并促进了对人类交流的更深入理解4,5。根据2001年的人口普查结果,印地语与英语融合而成的语言——“印英混合语”(Hinglish)目前在印度约有1.2亿人使用6。
从当前学习算法的发展格局来看,主动学习已显现出作为一种强大工具的潜力,可显著减少在标注大型数据集时所需的人工投入,尤其在情感识别领域表现突出。这种迭代方法通过选择性地标注具有重要影响的样本(辅以适当的度量标准),不仅提高了标注的准确性,也提升了效率5。先前的研究已证明,该方法在大幅降低人工标注工作量的同时,能够在使用更小训练数据集的情况下维持甚至提升模型性能,并提出了一种基于聚类分析的信息性样本选择方法7,8。在特定的印地语-英语混合(Hinglish)情感识别背景下,研究人员已通过深度学习模型和多标签标注数据集做出了有价值的贡献9,10,11。以往研究12,13 已引入主动学习与半监督方法,以降低对人工标注数据的依赖,进一步提升效率并减少标注成本。此外,多项项目已证实主动学习在提升分类性能方面的有效性,尤其是在多标签情感分类任务中表现显著14。
主动学习在提升分类器性能方面的有效性已在各种机器学习应用中得到认可。研究15,16强调了其在教育应用中提升性能的关键作用。类似地,一项早期研究提出了一种支持向量机的主动学习新算法,显著减少了对标记样本的需求17。另一项工作还探讨了其在涉及结构化实例任务中的应用,例如文本分类18。主动学习对情感识别任务的影响不仅限于效率提升,尤其体现在减少对人工标注数据的依赖方面。一项研究提出了一种用于情感分类与回归的多任务框架,其性能优于单任务方法10。
此外,研究人员19在利用主动学习进行语音和文本情感识别方面取得了显著进展,同时证明20 其在个性化音乐情感分类中的有效性。然而,情感的分类与标注过程面临重大挑战,这一点在情感分析背景下尤为突出21,22。有研究指出,标签的使用会显著影响情感分类,特别是对于后习得的情感类别23。为应对这些挑战,已开发出多种算法,包括基于关键词和基于学习的方法,并实现了较高的准确率24。基于书面语句和文本的情感研究已在多种模型中展开,其中一些方法采用基于规范数据库的维度模型以实现有效的情感检测25。在另一项研究中26,一种认知情感模型增强了用于社会情感原因识别的序列方法。该研究作者提供了OCC情感模型的计算语言学解释,而类似的研究27则提出了一种利用本体论来表示词语依存关系和情感的系统。一项研究的作者28讨论了与情感词汇处理相关的信号,强调了大脑在书面语言中表达情感时的适应机制。对包括多模态数据在内的多种原始情感阵列进行标注具有挑战性。然而,对与战争和冲突相关的情感进行研究,为极端条件下的人类心理提供了科学且系统的观察窗口,使我们能够更好地理解个体和群体如何应对创伤、丧失和不确定性5。另一项研究发现,标注技术有效提升了体裁分类效果,其中标题特征在该过程中发挥了关键作用29。一项研究创建了一个包含44K样本的视觉-触觉数据集,利用专家标注和GPT-4V训练了一个触觉编码器和一个TVL模型用于文本生成30。另一项研究探讨了政治类推文的意见与趋势挖掘,聚焦于主动学习过程,以自动标注关于政治人物的法语推文41。还有一项研究提出了CloudFlows,这是一种基于云的科学工作流平台,专为数据流中的动态自适应中心分析而设计。该平台通过主动学习提升情感分类性能,使算法能够实时适应数据变化42。
人类情感的复杂性与实现自动化情感分析的愿望之间存在着明显的矛盾。人类情感的复杂性与自动化情感分析的目标之间存在固有的张力。目前大多数研究工作都承认人工标注的局限性,并强调需要采用复杂的计算方法来应对理解多种交流形式中情感所面临的挑战。理想的情况是直接获取句子撰写者或说话者的情感标注43,但这种理想情况在很大程度上并不现实。具体而言,直接从撰写或说出句子的个体获取标注数据的理想方案在实践中难以实现,其不可行性源于无法在大规模上收集和处理如此个性化的标注信息。因此,当前的研究工作必须依赖专家标注人员或自动情感检测算法来分析和标注文本中表达的情感。在本项研究中,我们尝试克服该领域中部分挑战。以下将阐述本研究在该问题领域中的主要贡献44。
因此,我们需要依赖专家或标注人员以及情感检测算法来分析和标注文本中表达的情感。大规模地收集和处理此类个性化的标注是不可行的。因此,在本研究工作中,我们尝试克服该领域知识中的某些方面。以下是本问题领域的关键贡献。
该框架结合了基于规则的方法(如情感标注、语码转换检测和表情符号解读)与随机森林和词嵌入等机器学习技术,提高了标注的准确性,同时减少了人工工作量。分类器的迭代学习 采用了主动学习和迁移学习,优先处理特征不明确的样本,从而降低了对繁重人工劳动的依赖。与完全依赖人工手动标注相比,该方法使运营成本降低了40%。
为了在细粒度层面处理混合印地语-英语(Hinglish)的复杂性,我们开发了一种定制的上下文敏感分词方法。该方法通过考虑语码转换、标点符号、表情符号和子词切分,对混合文本进行处理,从而实现对印地语-英语混合文本更准确的情感标注。在细粒度层面,我们为Hinglish文本开发了定制的上下文敏感分词方案。该框架通过融合双语情感词典、子词分词以及定制的上下文敏感分词技术,应对语码混合文本的复杂性。词法规则解决了89%的语码转换歧义问题。
我们的研究基于已确立的情绪心理学理论,例如离散情绪理论和认知评价理论。该研究展示了该方法在危机响应和社会媒体监测中的可扩展性,为资源有限的多语言自然语言处理应用提供了蓝图。
表 1 列出了针对相同问题领域的现有研究。通过文献调研和表格化总结可知,大多数研究仍无法避免采用人工方法进行初步标注工作。少数研究人员正在采用半自动化的标注方法41。然而,真正影响性能的关键在于使用有效的学习模型,以实现标注过程的自动化。推文中的情感内容必须符合用于解释人类情绪路径及情感组织结构的相关理论。下一节将基于现有方法的局限性以及相关论文的实证结果,对问题进行定义。
| 研究 | 数据集 | 情绪 | 方法 | 语言 | 标注过程 | 不足 | 未来研究方向 | ||||
| [31] | 9,000,000 条推文 | 紧张、抑郁、愤怒、活力、疲劳 | 情绪状态混淆剖面图 | 英语 | 无标注 | 该研究忽略了惊讶、喜悦或恐惧等细微情绪差异,表明情绪标注可增强情感趋势的可解释性和细粒度,尤其是在与社会经济事件相关的情境中。 | 未来可研究如何利用自动化分类方法和成熟的情绪分类体系,更好地捕捉和分析社交媒体数据中的多种情绪表达。 | ||||
| [32] | 7000 条推文 | 愤怒、厌恶、恐惧、喜悦、爱、悲伤 | 支持向量机 | 英语 | 人工标注 | 由于数据集主题特定且无法代表整体推特使用情况,其泛化能力有限。 由于主观解释和上下文信息极少,标注者间一致性较低,因此对简短、随意的推文进行情绪标注具有挑战性。 | 未来工作将聚焦于通过区分主题特定和情绪特定的语言风格,开发更优的情绪检测模型,从而在多样化的推文语境中实现更准确的分类。 | ||||
| [33] | 21,000 条推文 | 愤怒、厌恶、恐惧、喜悦、悲伤、惊讶 | 支持向量机 | ------ | 使用话题标签 | 现有的情绪标注语料库在规模和领域上均有限,缺乏适用于微博的大型多样化数据集。推文篇幅短、噪声多、上下文有限,使得准确的情绪检测与标注十分困难。 | 未来研究可能包括扩展情绪词典,加入同义词和额外的话题标签,以提高覆盖范围和检测准确性。 | ||||
| [34] | 16485 条推文 | 愤怒、厌恶、恐惧、喜悦、悲伤、惊讶 | 支持向量回归 | 中文 | 人工标注 | 传统情绪分类方法常忽略情绪的潜在成因,限制了特征质量。 从简短、非正式的微博帖子中准确提取情绪成因,需要稳健的基于规则的系统和领域知识。 | 进一步探索情绪成因分析可提升情绪检测模型性能,并为文本情绪理解开辟新方向。 | ||||
| [35] | 10,040 条推文 | 恐惧、希望、喜悦、愤怒、惊讶、 悲伤、厌恶 | LDA、标注者间一致性 | 印英混合语(Hinglish) | 人工标注 | 目前缺乏公开可用的、结构化的印英混合语数据集,尤其是用于捕捉危机相关内容中语用和情绪细微差别的数据集。印英混合语是一种非标准的语码混用语言,地区差异使准确的情感分析和标注变得复杂。 | 未来应扩展多模态数据集,将深度语用分析与机器学习模型结合,并解决冲突话语中实时情绪追踪的可扩展性问题。 | ||||
| [36] | 134,000 条推文 | 活跃、不活跃 快乐、不快乐 | 支持向量机和K近邻算法 | 印英混合语(Hinglish) | 使用话题标签 | 人工对推文进行情绪标注费时费力且不一致,限制了大规模情绪分类工作的开展 众包标注缺乏可靠性,尤其在识别情绪唤醒水平方面,凸显了情绪解释的主观性。 | 未来应聚焦于优化基于话题标签的标注方法,并扩展情绪检测模型,以提高在不同情绪语境下的准确性和泛化能力。 | ||||
| [37] | 来自37个国家的3,000名学生、心理学家和非心理学专业人士 | 喜悦、恐惧、愤怒、悲伤、厌恶、羞耻和内疚 | -- | ----- | 人工标注 | 对文化因素如何影响不同社会中特定情绪的调节与表达,目前研究尚不充分。在普遍性情绪模式与文化特异性的情绪诱发和解释差异之间取得平衡,仍是一个复杂问题。 | 未来研究应深入探讨生物普遍性与文化背景在塑造情绪体验和交流中的相互作用。 | ||||
| [38] | 12000 | 快乐、悲伤和愤怒 | 标注者间一致性 | 印地语+英语 | 人工标注 | 当前研究缺乏全面标注的数据集和标准化的印英混合语情绪检测模型。社交媒体文本语法不规则且语码混用,使得准确的情绪分类十分困难。 | 未来工作将 聚焦于扩展情绪类别,并开发更大规模的多语言语码混用数据集。 | ||||
| [39] | 2866 | 快乐、悲伤、愤怒、惊讶和悲伤 | 支持向量机 | 印英混合语(Hindi+English) | 人工标注 | 缺乏情绪标注的语码混用数据集。 语码混用文本中的情绪表达在不同语言和文字间存在差异,使标注和分类变得复杂。 | 未来工作可扩展语料库以包含更多情绪类型,整合词性标注,并探索多语言语码混用内容。 | ||||
| [40] | 13738 | --- | 机器翻译(谷歌翻译) | 印英混合语(Hinglish) | 人工标注 | 现有机器翻译系统在语码混用的社交媒体数据上准确性不足,原因是缺乏大规模、领域特定的平行语料库。拼写变异高、结构非正式以及语言识别的模糊性,使罗马化印地语-英语文本的翻译更加复杂。 | 该语料库可支持语码混用翻译系统的开发,并可扩展至其他低资源语言及命名实体识别等自然语言处理任务。 | ||||
| [41] | 11527 | 正面、非常正面、负面、非常负面 | 基于kNN的分类、词袋表示法 | 法国政治人物 | 人工标注 | 高质量标注数据集在非英语政治观点挖掘中的可用性有限。在大规模推文数据集中,如何在减少标注噪声的同时保留信息,并处理标签分布不均的问题,是主要难点。 | 未来工作可能优化主动学习方法,以在多语言政治话语中更好地保留关键内容,同时最小化标注噪声。 | ||||
| [42] | 764,416 | --- | K均值聚类、支持向量机 | 英语 | 半监督 | 情感分析中的实时标注和模型更新受到数据流变异性、标注成本和系统可扩展性的限制。 | 未来工作将探索多类别情感分类,整合更多标注策略,并加强对初始模型生成的控制。 | ||||
表1:现有研究及其对应的标注方法。该表格全面比较了现有研究,探讨了情绪标注问题,梳理了方法论框架,并明确了本研究在现有文献中的贡献。
问题陈述
在情感标注研究中,最常被关注的情感类别深受埃克曼(Ekman)和普鲁奇克(Plutchik)等基础心理学模型的影响,主要集中在愤怒、恐惧、快乐、悲伤、惊讶等核心情感类别上44。因此,在本项研究中,我们致力于探讨这些已被广泛认可的情感内涵。挑战在于构建一个动态的计算框架 F,能够准确地为聚焦战争与冲突语料库 T 中的混合印地语(Hinglish)文本实例(tᵢ)标注来自预定义集合 E = {e1, e2, ..., e8} 的情感标签(eᵢ)。该框架必须整合情感建构理论(Constructionist Theory of Emotion)、情感事件理论(Affective Events Theory, AET)、离散情感理论(Discrete Emotions Theory)以及认知评价理论(Cognitive Appraisal Theory)的原则,以建模与冲突相关话语中多维度的情感图景。语料库 T 中的每个文本实例 tᵢ 在语言上具有高度复杂性,融合了使用罗马字母书写的印地语、英语、表情符号及符号,因此需要采用多层次的方法来捕捉细微的情感表达。
与战争相关的情感(以案例研究为例)的计算模型可能涉及一个多层面的方法,首先从处理基于印地语-英语混合语(Hinglish)的语言细微差异的词汇规则开始。分词(记为 T)涵盖使用罗马字母书写的印地语(即以罗马脚本书写的印地语)、表情符号及标点符号,构成语言处理的基础。情感词典(记为 D)将不同语言中的词汇映射到特定情感,如愤怒、喜悦等,其中每种情感_i在语言_k中对应若干词汇_j。子词分解(记为 S)将复合词拆解为其构成的子词,从而实现对复杂表达的深入理解。随后,机器学习技术(记为 M)利用词嵌入(记为 E),例如 Word2Vec/fastText,将分词转化为向量表示(记为 vector_v),以支持数值分析。集成分类器(记为 C),如随机森林(Random Forest),基于这些向量集合预测情感标签(记为 emotion_label_p)。为了迭代优化标注学习模型,采用主动学习机制(记为 AL)。专家反馈(记为 F)通过为模糊样本(记为 ambiguous_sample_q)分配精细化标签(记为 refined_label_r),对不确定案例进行修正,提供关键的纠正信息。样本优先级划分(记为 P)聚焦于低置信度样本(记为 low_confidence_sample_s),为其分配标注优先级(记为 annotation_priority_t),从而优化整个标注流程。
通过整合这些组件与理论,该框架旨在动态处理混合印地语-英语文本,弥合语言和文化差异,并自适应地优化情感标注,为分析冲突话语中的情感维度提供可扩展的解决方案。
访问受限。请登录或开始试用以查看此内容。
本节还解释了用于8种情绪标注的多模态框架是如何构建的。首先讨论数据集的特性,然后介绍后续步骤。为了更好地理解研究流程,请参见图1。

图1:情感标注的系统性框架。 该图展示了通过结合机器学习、主动学习和基于专家输入的动态词典规则,对混合使用英语和印地语的文字(Hinglish)进行有效情感标注的流程;通过对误分类样本的逐步优化,不断提升标注准确率并降低标注成本。 请点击此处查看此图的放大版本。
数据集准备
数据收集首先通过确定与战争冲突及相关情绪有关的全面关键词和话题标签列表来开展。通过学术文献、新闻报道以及社交媒体趋势等资源,整理出相关且已有的列表。
根据图1,在完成推文收集和数据预处理后,需要由人工专家进行手动标注,并制定需纳入的词法规则,以改进标注过程。利用这些关键词(如冲突、战争、危机、gussa等),收集了包含10,040条推文的初始数据集,并以此作为手动标注的基础,每条推文均被标注为八种预定义情绪之一(愤怒、恐惧、快乐、悲伤、挫败、同情、混合情绪,以及其他与战争和冲突领域相关的情绪)。手动标注工作由一支精通印地语和英语的专家团队完成,确保准确捕捉英语中的细微语义。
以下描述了一个处理示例。
分词与预处理:
输入推文:“我感到很害怕
“
分词输出:[“我”,“感到”,“很”,“害怕”,“
”]
罗马字母处理:印地语词汇(“Mujhe”,“Bhayanak”)以罗马字母形式保留。
表情符号/符号识别:“”被单独识别为一个符号标记。
情绪词典映射(D):
使用双语(印地语/英语)情绪词典将标记映射到 E 中的情绪:“Bhayanak”(印地语中“horrible”的意思)→ 恐惧;“lag raha hai”(表示正在进行的情绪的语境短语)→ 恐惧;“
” → 愤怒
子词分解(S):
分解复杂术语以进行深入分析:“Bhayanak” → [“Bhay”(恐惧),“anak”(后缀)],以阐明其语义根源在于恐惧。
嵌入生成(E):
使用 Word2Vec/fastText 生成词元嵌入:对 ["Mujhe", "Bhayanak", "lag", "raha", "hai", "
"] 生成嵌入向量 v1, v2, v3, v4, v5, v6。
聚合规则:对词元嵌入取平均值以生成全局语义向量:
V_avg = (v1 + v2 + v3 + v4 + v5 + v6) / 6
基于规则的特征提取:
提取用于拼接的辅助特征。情感标签计数:恐惧:2 次(“Bhayanak”、“lag raha hai”);愤怒:1 次(“
”)。
语码转换标志:二进制标志 = 1(混合使用印地语和英语词元:“Mujhe” [印地语],“lag”、“raha”、“hai” [源自印地语])。
特征融合:
将聚合的嵌入向量与基于规则的特征组合成一个统一的输入向量:全局语义向量 = V_avg(平均嵌入向量),情绪计数 = [恐惧:2,愤怒:1,其他:0],语码转换标志 = 1
拼接规则 最终输入向量 = V_avg
[恐惧:2,愤怒:1,其他:0]
[1]
机器学习算法处理该最终向量,并开始迭代优化标注的过程。在下一节中,我们将讨论为此目的所采用的主动学习方法的性能表现。
此后,数据集被扩展至19,000条推文。该数据集通过自动与半自动技术相结合的方式进行整理,利用了初始人工标注所获得的洞察。扩展后的数据集通过迭代学习过程进一步优化,该过程包括选择性地识别和优先处理模糊数据/推文,由领域专家进行标注并提供反馈,以提高标注的准确性、一致性和效率。在整个数据收集过程中,特别注意保持不同情绪类别之间的平衡,确保数据集能够代表关于战争与冲突所表达的多样化情感。最终得到的数据集是分析Hinglish文本的宝贵资源。为便于理解,可参考图2。

图2:数据集收集流程。 该图展示了从种子词识别、人工标注、主动学习,到最终生成标注数据集的全过程。请点击此处查看该图的放大版本。
在通过主动学习完成迭代优化过程后,对数据集进行最终整理。主动学习被应用于一个混合框架中,该框架包含词汇规则、机器学习以及迭代式的专家输入,用于标注混合印地语-英语(Hinglish)语句的情感。具体步骤如下:
该过程始于一个手动标注的数据集。使用随机森林分类器识别出机器学习模型不确定的模糊推文。将这些模糊样本发送给人工专家进行分类。利用最新标注的数据反复更新模型,逐步提高准确率并减少误分类。最终确定数据集,并审查标注以确保准确性。准备数据集以供分析,确保其得到妥善记录和格式化,以便在后续应用中使用。然而,重要的是要探究语句中蕴含的情感模式,以使后续实施步骤更加清晰。因此,在下一步中,将进行聚类分析以发现数据集中主要的情感类型。这也有助于识别我们正在研究的具体情感。
情绪簇的选择
表2展示了情绪类别及其对应的印地语-英语混合表达,以及选择相应情绪的原因。从每一类情绪中选出一种主导情绪用于后续处理。这些主导情绪是通过聚类分析确定的。
| 情绪类别 | 印地语-英语混合表达 | 选择依据 |
| 恐惧(包括焦虑和恐慌) | Dar, khauf, Asahaj, Bekabu, Angadai, Chinta, tension, Fikr, Ashanka, Udaasi, Bechaini, Ghabrahat | 恐惧是战争与冲突中常见的情绪,因为个体面临安全与福祉受到威胁的情况。这种恐惧可能以多种形式表现,例如焦虑、惊恐发作和过度警觉。 |
| 愤怒(包括烦躁、敌意、挫败感和受伤感) | Gussa, raag, Prakop, Raudra, Chidhaan, Shatruta, Krodh, Gussa dilana, apata, Atyachar, Khushfehmi, hairani, Bhayanak, Chakker Kathinaai | 愤怒是战争与冲突中的另一种普遍情绪,通常源于不公、背叛或损失的感受。这种愤怒可能助长攻击性和暴力行为,加剧冲突的破坏性。 |
| 悲伤(包括悲痛、绝望和无助感) | Udaasi, gham, Shok, Bhavuk, Dukhi, Udas, Vismay, Nirasha, Shok, Dukhi, Vairagya, Aashank, Vishada, Bhavuk, Dukhi, Udas, Vinamrata, Bhavuk, Hridaytoda, Beumaar, nirasha, Vinaash, Bair, Nirasha, Asambhav, Haar | 悲伤是对损失和哀伤的自然反应,而在战争与冲突中,这类经历不幸十分普遍。士兵可能因战友的牺牲而悲伤,平民可能为逝去或流离失所的亲人哀悼,整个社区可能为其家园和生活方式的丧失而悲痛。由于冲突持续时间长以及暴力循环似乎永无止境,人们也可能产生绝望和无助的情绪。 |
| 羞耻与内疚 | Sharm, lajjabari, Sharm, Laaj, Zillat, Afsos, Gunah, Afsos, Pashchatap, Laaj, Bechaini, Aatmasamarpan, Sharmindagi, Ashru, Pashchatap, Antaratma, Kasoor, gunaah, Khud ko doshi maana, Ninda, Dosha | 羞耻与内疚是复杂的情绪,可能源于个人或集体的错误行为、无能感或屈辱感。在战争与冲突中,个体可能因自身行为、未能阻止他人受到伤害,或因他人死亡而自己幸存而感到羞耻或内疚。 |
| 厌恶 | Ghin, nafrat, Asahayak, Pratikool, Ghrina, Vairagya, Dvesha, Nakaratmak, Vibhavsu, Vairagya, Vairagya, Nirasha | 厌恶是一种对被认为令人反感或冒犯的事物产生的反感或排斥情绪。在战争与冲突中,个体可能对残忍、暴力和野蛮行为产生厌恶感。 |
| 共情与同情 | Sahaaanubhuti, hamderdari, Samajhdari, Daan Sahabhooti, Sensitivity, Supportiveness, Consideration, Kindness, Caring, Warmth, Tenderness, Daya, raham, Sahaaanubhuti, Sahyog, Dayalu, Samajh, Pyar, Daya, Narami, Paropkari | 共情与同情对于理解并分享他人感受至关重要。在战争与冲突中,共情可以成为与有相似经历者建立联系、培养同情心并促进和解的有力工具。同情心可激励个体帮助有需要的人,并推动愈合与重建工作。 |
| 希望与感恩 | Umeed, aasha, Chah, Ichha, Sapna, Unnati, Ashvasan, Khushi, Utsaah, Ashirwad, Samvedansheelata, Vishwas, Bharosa, Shukraguzaar, eshaananand, Shukrana, Aabhaar, Namrata, Samaanya, Naman, Aasherewad, Badhai, Dhanyavaad, Abhivadn, Manobhav, Bhakti | 希望是一种尽管面临挑战与困难,仍相信好事将发生的乐观与期待感。感恩是对生活中美好事物的感激与珍视之情。在战争与冲突中,希望可以成为力量与动力的源泉,使个体坚持下去并努力追求更美好的未来。感恩有助于个体关注生活中的积极方面,增强心理韧性,并在动荡中培养内心的平静。 |
| 心理韧性 | Jheelaanek, himmat, Sahasi, Sahas, Dhairya, Majbooti, Samvedansheel, Samarthya, Majbuti, Lachari | 心理韧性是指适应并应对困难或挑战性情境的能力。在战争与冲突中,心理韧性对于个体和社区在逆境中生存与坚持至关重要。 |
表2:情绪选择的依据。 该表格将情绪类别与其对应的印地语-英语混合表达进行对应,并解释了它们在战争与冲突情境中的相关性。
然而,需要注意的是,这些情绪的选择不仅基于聚类分析,还建立在情绪理论基础之上,包括认知评价理论(Cognitive Appraisal Theory, CAT)、离散情绪理论(Discrete Emotions Theory, DET)和情绪的过程导向理论(Process-Oriented Theory, POT)43。
语料库详情
该数据集包含特定领域(战争、冲突和危机)以及混合了印地语和英语推文的附加推文数据集。图3展示了本研究工作中正在处理的公开可用推文数据集的截图。主数据集可从以下网址公开获取:https://data.mendeley.com/datasets/y63frd6pmf/7。

图3:语料库详细信息。 此处说明了数据集的可用性。请点击此处查看该图的放大版本。
情感标签标注
由双语专家对一个包含 10,040 条与战争和冲突相关的Hinglish推文的初始语料库,手动标注了八种情感标签。为应对语码混杂文本的语言复杂性,开发了一种基于词法规则的框架,包含多个组件。该框架包括情感特定词典,将印地语/英语词汇映射到相应情感,例如 fear_words = {Fear, Dread, Bhayanak,
, Terror,
} 和 anger_words = {gussa, rage,
, irritation,
}。跨语言等价规则用于关联这些词汇(例如,若 (Ae == Ah):anger = gussa |
)。所使用的词法规则包括情感词典、混合语言的分词处理以及子词分解。为了标注情感,这些规则对文本进行预处理并提取特征,随后与机器学习嵌入向量相结合45。
用于分词, 该框架针对语言切换、标点符号、表情符号和子词切分采用了自定义规则。印地语(天城文)文本按字符级别进行切分,而英语(拉丁字母)则按空格切分。示例: 我感到沮丧 → [我感到沮丧]。井号(#)和提及符号(@)等特殊字符被单独切分为独立的标记(例如, #战争罪行 → [#, 战争罪]), 而逗号 (,) 和感叹号 (!) 等标点符号则被分割为单独的标记(例如
→
, !]).
表情符号也被视为独立的标记,并映射到相应的情绪(例如,
→ 愤怒,
→ 悲伤)。使用天城文脚本进行子词标记化处理,其中复合词通过符合连音规则(Sandhi)的正则表达式模式进行拆分(例如,
] [kingdom + world]);对于罗马字母脚本,则对前缀和后缀进行分段处理(例如,unbelievable → [un, believable])。在领域特定扩展中,若标记在词典中匹配成功,则替换为对应的情绪标签。例如:Bhayanak → 恐惧,Dahad → 恐惧,gussa → 愤怒。推文 Mujhe Bhayanak lag raha hai → 标记 [Mujhe, 恐惧, lag, raha, hai]。
向量化后,处理后的词元(词语、子词、表情符号)通过 Word2Vec/fastText 被转换为 300 维的嵌入表示。这些词元的数值表示形式为列向量,构成一个与词元对应的向量矩阵。矩阵中的每一行对应文本中某个词元的嵌入向量,表示该词元的顺序;每行中的各列则表示嵌入空间中的维度。这些向量包含通过 Word2Vec 和 FastText 计算得到的实数。具有零向量的词元(即所有值均为零的行)可能表示在此表示中不包含有意义信息的空格或特殊字符。嵌入表示旨在捕捉词语间的上下文关系,以提升标注效果。非零向量表示词语或符号具有实际意义的表示。这些向量中的数值编码了多种语义和句法特征。零向量通常代表填充符、空格或未识别的词元。数值的变异性反映了嵌入模型所捕捉特征的丰富性。不同的向量维度捕捉词语在意义、上下文和用法上的不同方面。图 4展示了向量的表示方式,而从图 5可以理解使用向量化过程的意义。

图 4:自定义分词。该图展示了向量在嵌入空间中的表示方式,并说明了每个标记如何被转换为数值格式 请点击此处查看此图的放大版本

图 5:标记向量化过程及其意义。 该图说明了这些过程和组件的含义,并强调了这些嵌入向量如何捕捉情绪的语义信息,以实现准确的情绪分类。请点击此处查看该图的放大版本。
根据研究流程,该过程首先解析输入文本,利用基于规则的词典扩展词元,然后将这些词元分解为子词。这种方法有助于理解文本的情感内容和文化背景,研究的伪逻辑如下所示。
初始化情感词典(例如,fear_words = {"Fear", "Dread", "Bhayanak", ...}):设置 Ae = Ah
SubwordRules(词元, 脚本):若为天城文 → 使用正则表达式拆分(复合词/Sandhi),若为拉丁文 → 使用正则表达式拆分前缀/后缀,返回子词
DomainSpecificExpansion(词元):若词元在情感/语言学词典中 → 返回对应情感
否则 → 返回原词元
ProcessTweet(文本):定义针对天城文、拉丁文及其他文字的正则表达式;使用正则表达式提取词元;对词元应用 DomainSpecificExpansion 和 SubwordRules;返回处理后的子词
将词元向量化为数值嵌入
结合人工反馈应用主动学习
访问受限。请登录或开始试用以查看此内容。
本研究结果表明,将词汇规则与机器学习及主动学习技术相结合,为提升混合式印英(Hinglish)文本情感标注的效率与准确性提供了一条可行路径。通过迭代优化与专家建议,所提出的框架在保持进化矩阵中高性能的同时,显著减少了人工工作量。研究结果表明,该方法在需要可扩展情感识别解决方案的领域具有广泛应用潜力,特别是在社交媒体分析和危机信息学等多语言且资源受限的环境中。
词汇规则与机器学习特征的整合
该框架还包含使用随机森林分类器的主动学习工作流程,用于识别模糊的推文(例如,混合愤怒/挫败情绪线索),以便专家重新标注。通过人工反馈对词典和模型进行迭代优化,在八次迭代后准确率从72%提升至81%。词汇规则与机器学习特征的整合,将基于词汇规则的特征与分布式语义嵌入相结合,为随机森林分类器构建出稳健的输入表示。基于规则的特征提取利用词汇规则从原始文本中生成结构化元数据,并将其转化为分类或数值型特征,形式为情绪标签:匹配情绪词典的...
访问受限。请登录或开始试用以查看此内容。
本研究的数据集通过人工标注与主动学习相结合的方式进行整理。最初,10,040 条与战争和冲突相关的印地语-英语混合推文被人工标注了八种预定义情绪。随后,通过半自动化方法将数据集扩展至 19,000 条推文。主动学习实现了专家的有针对性干预,使人工工作量减少了 40%,同时保持了 81% 的高标注准确率,F 值为 0.76。词汇规则和情绪特异性词典在解决 89% 的语码转换歧义问题中发挥了关键作用。主动学习框架对模型进行了迭代优化,使准确率从 72% 逐步提升至 81%。
词汇规则与机器学习的整合
该框架有效地将基于规则的特征与机器学习相结合。词汇规则被用于分词、子词分解和情感映射,而词嵌入(Word2Vec、fastText)则提供上下文表示。采用随机森林分类器识别出需要专家重新标注的模糊推文。该模型经过多次迭代不断优化,降低了误分类率,同时提升了精确率与召回率。
机器学习模型的性能
对梯度提升和随机森林分类器的比较分析显示,两者性能相似,标注...
访问受限。请登录或开始试用以查看此内容。
作者声明无利益冲突。
本研究未获得外部资金支持。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| fastText | Facebook AI | N/A | 词表示与分类 |
| Google Colab | N/A | 基于云的 Jupyter Notebook 环境 | |
| Google Colab GPU/TPU | N/A | 基于云的硬件加速 | |
| Intel Core i5/i7 或 AMD Ryzen 5/7 | Intel / AMD | N/A | 本地执行用处理器(如需要) |
| Matplotlib | 开源 | N/A | 数据可视化库 |
| NLTK | 开源 | N/A | 用于文本处理的自然语言工具包 |
| NumPy | 开源 | N/A | 数值计算库 |
| NVIDIA GTX 1650 或更高(可选) | NVIDIA | N/A | 用于深度学习任务的 GPU |
| Pandas | 开源 | N/A | 数据处理库 |
| Python | Python 软件基金会 | N/A | 用于机器学习与自然语言处理的编程语言 |
| PyTorch | Meta AI | N/A | 深度学习框架 |
| 内存(最低 8GB,推荐 16GB) | Various | N/A | 机器学习任务的内存需求 |
| Scikit-learn | 开源 | N/A | 机器学习库 |
| Seaborn | 开源 | N/A | 统计数据分析可视化 |
| SpaCy | Explosion AI | N/A | 工业级自然语言处理库 |
| 固态硬盘存储(最低 256GB,推荐 512GB) | Various | N/A | 用于数据集处理的存储空间 |
| TensorFlow | N/A | 深度学习框架 |
访问受限。请登录或开始试用以查看此内容。
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可