合作交流

当前位置: 网站首页 > 合作交流 > 文化管理与政策学术创新共同体 > 正文

文化管理与政策学术创新共同体

大语言模型辅助文本分析:方法框架与实施规范

发布时间:2026-09-07   信息来源:    浏览量:

一、引言

长期以来,文本分析的基本路径是将文本转化为可统计的形式:分词统计、词典匹配、主题模型等。这一路径的代表性成果,是 Blei 等人 2003 年发表于《Journal of Machine Learning Research》的潜在狄利克雷分配模型(LDA),该文至今仍是机器学习领域引用量最高的文献之一。1

此类方法存在固有局限:其处理对象是词频而非语义。"这部作品具有东方韵味"与"这部作品不具有东方韵味",在词频层面的差异极小;反讽、隐喻与语境依赖的判断,均超出了词袋模型的能力范围。

大语言模型(Large Language Model, LLM)的出现,使以往依赖人工阅读理解的编码工作具备了规模化实施的技术条件。与此同时,模型输出与研究目标之间的偏差风险亦相应上升。因此,大语言模型文本分析需要一套规范化的实施流程,而非一句提示词即可完成的操作。

本文依次说明任务类型、技术路线、实施流程、实证证据与风险防控要点,供研究者参考。

二、任务类型辨析

选择技术方案之前,应首先明确研究任务所属的类型。四类任务的输出形式、前提条件与主要风险各不相同,见表 1。

表 1 大语言模型文本分析的四类任务

任务类型

典型问题

输出形式

是否需要编码本

主要风险

归类编码

该文本属于哪个类别?持何种立场?

标签

需要

类别边界模糊导致系统性误判

信息抽取

文本涉及哪些主体、事件与时间?

结构化字段

需要(先定义字段)

生成原文中不存在的内容

归纳发现

语料中反复出现哪些议题维度?

主题清单

不需要,但需人工确认

归纳结果缺乏针对性,流于泛化

解释生成

该文本为何应归入此类?

自然语言理由

需要

理由属于事后建构,不必然反映真实依据


实践中最常见的误用,是将归纳发现当作归类编码处理:由模型直接输出主题并写入研究结论,而省略了人工核对环节。归纳所得应视为候选假设,须经文本验证与人工命名后方可使用。

三、技术路线及其适用情形

大语言模型并未使既有方法失效。词典法、监督学习、语义聚类与大语言模型各有适用条件,常见做法是将其组合使用。五条路线的对比见表 2。

表 2 文本分析技术路线对比

路线

代表方法

优势

局限

适用情形

词典法

LIWC、自建领域词典

过程透明、可复现、成本低

无法处理否定与反讽

结论须完全可审计;长时段比较

词袋+监督学习

支持向量机等

有标注数据后成本低、结果稳定

需要数千条标注;跨领域泛化能力弱

已有大量历史标注,需处理全量数据

嵌入+聚类

BERTopic(UMAP 降维、HDBSCAN 聚类、c-TF-IDF 主题表示)2

无需预设类别,对语义敏感

主题数量需调参,标签须人工拟定

探索阶段,尚不清楚语料包含哪些维度

大语言模型直接编码

零样本、少样本提示

无需训练数据,修订编码方案成本低

输出存在波动,成本随规模线性增长

编码方案尚在迭代,数据量中等

蒸馏

以大模型标注训练小模型

兼顾成本与稳定性

依赖大模型标注质量

数据量大,或需反复重跑


五条路线在研究流程中通常呈递进关系:探索阶段可采用 BERTopic 等聚类方法识别候选维度;编码方案确定后,采用大语言模型按编码本实施标注;数据规模较大或需重复执行时,再以蒸馏方式固化至小模型。

此外,Grimmer 与 Stewart 在 2013 年提出的四项原则,在当前技术条件下仍然适用:3

一、所有语言的量化模型都是错误的,但其中部分是有用的;二、量化方法放大并增强人类能力,而非取而代之;三、不存在普遍最优的文本分析方法;四、验证,验证,再验证。

四、实施流程

规范的实施流程包括六个环节。

(一)编制编码本

编码本是研究测量承诺的书面化:研究者据此声明所测量的概念。每个类别应至少包含四项内容:定义、纳入标准、排除标准、边界案例的判定规则。编制标准是:其他研究者依据编码本能够独立作出一致判断。

(二)构建人工金标准集

从语料中随机抽取 300—500 条文本,由至少两名编码员独立编码,并计算编码者间信度。信度指标推荐使用 Krippendorff's α(适用于多名编码员、多种测量尺度及缺失数据情形),两名编码员情形亦可使用 Cohen's κ。4 仅报告一致率是不充分的,该指标未扣除偶然一致的成分。

若人工编码员之间的信度未达标准,应首先修订编码方案,再考虑引入模型。按照 Krippendorff 提出的通行标准,α ≥ 0.800 方可用于可靠结论,0.667—0.800 之间仅可作暂定结论,低于 0.667 的数据应予弃用。16

(三)将编码本转写为机器可读的提示词

人工编码本不宜直接输入模型。Dunivin 2025 年发表于《EPJ Data Science》的研究表明:需针对机器理解重新转写编码描述,补全默认前提,将"视情况而定"的表述改为明确的判定规则,并写入边界案例;同时,要求模型以结构化格式输出、先陈述理由再给出标签(即思维链方式),可显著提高编码保真度。5

提示词可参照如下框架:

你是一名经过训练的内容分析编码员。

 

【任务】判断下面这段文本是否体现了「XXXX」。

 

【定义】XXXX 指的是……

 

【判为 1 的情况】

- ……

 

【判为 0 的情况】

- ……(注意:仅有……不足以判为 1)

 

【边界案例】

- 例 1:「……」→ 判 0,理由是……

- 例 2:「……」→ 判 1,理由是……

 

【输出要求】

先用不超过三句话陈述判断依据(须引用原文关键信息),再给出结论。

若信息不足以判断,label 输出 "unknown",不得猜测。

严格按以下 JSON 格式输出:

{"reason": "...", "label": 1}

 

【待编码文本】

"""

三项技术要点:其一,"信息不足不得猜测"须明确写入,否则模型倾向于强制给出答案;其二,要求引用原文,可抑制内容编造;其三,固定输出为 JSON,便于程序化处理。

(四)小样本试测与迭代

以金标准集对模型进行试测,重点考察各类别的召回率,而非仅看总体准确率。常见情形是:某一类别占比很小(如 5%),模型将其全部判入大类,总体准确率仍可达 95%,而该类别召回率为零。此类错误在已发表研究中并不罕见。

迭代对象包括三方面:编码本表述(修订后人工版应同步更新)、边界案例(将判错样本择要写入提示词)、类别划分方案本身(部分问题源于分类不合理而非模型能力)。

(五)全量执行与结果报告

正式执行后,研究报告中至少应包含以下验证结果:

1.相对人工金标准的分类精确率与召回率(分类别报告,不以总体准确率替代);

2.将模型视为第三名编码员计算的 Cohen's κ 或 Krippendorff's α;

3.混淆矩阵,用于定位系统性混淆的类别对;

4.unknown 输出的比例及其处理方式。

方法部分还应完整交代:模型名称与版本号、调用日期、提示词全文(可置于附录)、温度等参数设置、人工复核的比例与方式。上述信息缺一不可,否则结果无法复核。

(六)分歧处理与模型蒸馏

对 unknown 输出及模型与人工不一致的样本,应进行全量或抽样人工复核。数据规模较大或需反复执行时,可利用大语言模型标注结果微调小模型后处理全量数据。需要说明的是,Mellon 等人 2024 年的研究显示,在已有大量历史标注的场景下,监督模型(DistilRoBERTa,训练数据 57.6 万条)准确率为 77.8%,最优大语言模型少样本结果为 80.9%:大语言模型领先,但幅度有限,方案选择应结合数据规模权衡。6

五、实证证据

大语言模型文本分析的效果,已有若干可核查的实证研究。六项代表性研究的任务与结果见表 3。

表 3 代表性实证研究汇总

研究

任务

主要结果

Gilardi、Alizadeh 与 Kubli,2023,《PNAS》7

推文与新闻的标注任务(相关性、立场、主题、框架检测等),样本量 6,183

零样本 ChatGPT 准确率较众包工人平均高约 25 个百分点;编码者间一致性在全部任务上高于众包工人与受过训练的标注员;单条标注成本低于 0.003 美元,约为 MTurk 的三十分之一

Törnberg,2023,arXiv 预印本8

美国政客推文的党派归属分类

GPT-4 的准确率与稳定性高于专家与众包编码员,偏差不高于人类

Mellon 等,2024,《Research & Politics》6

英国选举调查开放题归类,50 个类别

无训练数据情形:最优模型(Claude-1.3)93.9%,人类编码员 94.7%,最优监督模型 93.5%;已有历史标注情形:模型 80.9%,人类 88.6%,监督模型 77.8%

Ziems 等,2024,《Computational Linguistics》9

13 个模型、25 个计算社会科学基准

分类任务上,零样本大语言模型未超过最优微调模型,但与人类具有基本一致性;生成式编码任务上,模型给出的理由质量常优于众包工人的参考答案

Dunivin,2025,《EPJ Data Science》5

人文社科段落级质性编码

保留编码本迭代流程、面向机器重写编码定义、结构化提示与思维链,可明显提高编码保真度

Yue 等,2025,《JMIR》10

中文访谈文本的扎根理论编码(GPT-4-Turbo)

编码效率与多样性有所提升;在深度、语境把握、编码间关联与编码组织四方面弱于人工编码


依据上述证据,可形成三点判断:

第一,"大语言模型优于人类编码"是有条件的。有利条件为文本较短、类别界定清晰且无现成训练数据;当文本较长、判断依赖语境、或已有大量历史标注时,优势明显缩小,甚至发生逆转。Ziems 等的结论尤须注意:在标准分类基准上,零样本大语言模型未能超过最优微调模型。9

第二,大语言模型的合理定位是编码团队中的第二名编码员,而非人工编码的替代者。上述研究均未支持"全自动编码"的工作方式。

第三,中文语料与人文文本上的证据相对薄弱。现有研究绝大多数基于英文短文本。Baden 等人 2022 年指出,计算文本分析方法长期存在三个缺口:重技术而轻效度、聚焦单一内容抽取而社会科学需要测量复杂内容、工具链以英语为主导而限制了比较研究与非英语学界参与。11 其中第三点至今没有根本改变。据此,英文基准上的结论不宜直接推广至中文语料。

中文文献方面,林建浩、孙乐轩发表于《计量经济学报》2025 年第 1 期的综述,系统梳理了大语言模型在经济金融文本分析中的基本原理、应用场景与研究局限;12 龚为纲、黄思源发表于《求索》2025 年第 3 期的论文,讨论了大语言模型进入计算社会科学的工具、议题与挑战。13

六、主要风险与防控

(一)内容编造与强制作答

模型默认倾向给出确定答案,而非报告"信息不足"。防控措施:在提示词中明确"信息不足时输出 unknown";宁可损失部分样本,亦不应允许模型替代判断。

(二)系统性偏差

Zheng 等人 2023 年发表于 NeurIPS 的研究系统考察了"以模型为评判"的偏差类型:14

1.位置偏差:倾向选择先出现的选项。实测中 Claude-v1 有 75.0% 的判断偏向第一项,GPT-3.5 为 50.0%,GPT-4 为 30.0%;

2.冗长偏差:偏好更长的回答,即使内容冗余;

3.自我偏好:偏好与自身风格一致的答案。

防控措施:随机化选项顺序,或调换顺序重复判断;要求先陈述理由再输出标签;关键类别避免依赖单一模型。

(三)可复现性

需要特别说明:temperature 设为 0 并不保证输出完全一致。

Thinking Machines Lab 于 2025 年 9 月发布的实验显示:在 temperature 为 0 的条件下,对 Qwen3-235B-A22B-Instruct-2507 模型以同一提示采样 1,000 次(每次生成 1,000 个 token),得到 80 种不同输出,其中最常见的一种出现 78 次;全部输出的前 102 个 token 完全一致,分歧自第 103 个 token 开始。启用批不变(batch-invariant)算子后,1,000 次输出方才完全一致。15 其原因并非随机采样,而是浮点运算的执行顺序随服务器负载变化。

因此,实践中不应以"完全复现"为目标,而应以"可追溯、可追责"为目标,具体措施包括:

1.锁定具体模型版本号,不使用可能自动升级的别名;

2.保存每次请求的原始响应,连同时间戳与后端指纹(如 OpenAI 的 system_fingerprint 字段);

3.在论文中报告模型版本与调用日期;

4.对关键样本重复调用两至三次,报告结果稳定性。

(四)数据合规

访谈转录、未公开档案及含个人信息语料,不得上传至境外公开接口。人文社会科学研究尤须注意此项。替代方案为本地部署开源模型(如通义千问、DeepSeek 等开放权重模型,配合 Ollama、vLLM 等推理框架),确保数据不出校。本地部署可能带来编码质量下降,须以金标准集重新验证。

(五)将归纳结果直接作为结论

模型输出的主题清单属于候选假设,不属于研究结论。须回到文本中验证,主题命名须由研究者完成:主题的含义由研究者赋予,而非模型计算得出。

参考文献

1.Blei, D. M., Ng, A. Y., & Jordan, M. I. (2003). Latent Dirichlet Allocation. Journal of Machine Learning Research, 3, 993–1022.

2.Grootendorst, M. (2022). BERTopic: Neural topic modeling with a class-based TF-IDF procedure. arXiv preprint arXiv:2203.05794.

3.Grimmer, J., & Stewart, B. M. (2013). Text as Data: The Promise and Pitfalls of Automatic Content Analysis Methods for Political Texts. Political Analysis, 21(3), 267–297.

4.Hayes, A. F., & Krippendorff, K. (2007). Answering the Call for a Standard Reliability Measure for Coding Data. Communication Methods and Measures, 1(1), 77–89.

5.Dunivin, Z. O. (2025). Scaling hermeneutics: a guide to qualitative coding with LLMs for reflexive content analysis. EPJ Data Science, 14(1), 28.

6.Mellon, J., Bailey, J., Scott, R., Breckwoldt, J., Miori, M., & Schmedeman, P. (2024). Do AIs know what the most important issue is? Using language models to code open-text social survey responses at scale. Research & Politics, 11(1).

7.Gilardi, F., Alizadeh, M., & Kubli, M. (2023). ChatGPT outperforms crowd workers for text-annotation tasks. PNAS, 120(30), e2305016120.

8.Törnberg, P. (2023). ChatGPT-4 Outperforms Experts and Crowd Workers in Annotating Political Twitter Messages with Zero-Shot Learning. arXiv preprint arXiv:2304.06588.

9.Ziems, C., Held, W., Shaikh, O., Chen, J., Zhang, Z., & Yang, D. (2024). Can Large Language Models Transform Computational Social Science? Computational Linguistics, 50(1), 237–291.

10.Yue, Y., Liu, D., Lv, Y., Hao, J., & Cui, P. (2025). A Practical Guide and Assessment on Using ChatGPT to Conduct Grounded Theory: Tutorial. Journal of Medical Internet Research, 27, e70122.

11.Baden, C., Pipal, C., Schoonvelde, M., & van der Velden, M. A. C. G. (2022). Three Gaps in Computational Text Analysis Methods for Social Sciences: A Research Agenda. Communication Methods and Measures, 16(1), 1–18.

12.林建浩、孙乐轩(2025). 大语言模型与经济金融文本分析:基本原理、应用场景与研究展望. 《计量经济学报》, 5(1), 1–34.

13.龚为纲、黄思源(2025). 大语言模型与计算社会科学:工具、议题与挑战. 《求索》, 2025(3), 137–148.

14.Zheng, L., Chiang, W.-L., Sheng, Y., et al. (2023). Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. NeurIPS 2023 Datasets and Benchmarks Track. arXiv:2306.05685.

15.He, H., & Thinking Machines Lab. (2025 年 9 月 10 日). Defeating Nondeterminism in LLM Inference.

16.Krippendorff, K. (2019). Content Analysis: An Introduction to Its Methodology (4th ed.). SAGE Publications.


关闭

版权所有:西安建筑科技大学公共管理学院 | 站点维护:信息网络中心 | 联系邮箱:ggglxy@xauat.edu.cn | 联系电话:029-82203303

雁塔校区 地址:西安市碑林区雁塔路中段13号 710055 | 草堂校区 地址:西安市草堂寺景区草寺东路 710311