一、引言
长期以来,文本分析的基本路径是将文本转化为可统计的形式:分词统计、词典匹配、主题模型等。这一路径的代表性成果,是 Blei 等人 2003 年发表于《Journal of Machine Learning Research》的潜在狄利克雷分配模型(LDA),该文至今仍是机器学习领域引用量最高的文献之一。1
此类方法存在固有局限:其处理对象是词频而非语义。"这部作品具有东方韵味"与"这部作品不具有东方韵味",在词频层面的差异极小;反讽、隐喻与语境依赖的判断,均超出了词袋模型的能力范围。
大语言模型(Large Language Model, LLM)的出现,使以往依赖人工阅读理解的编码工作具备了规模化实施的技术条件。与此同时,模型输出与研究目标之间的偏差风险亦相应上升。因此,大语言模型文本分析需要一套规范化的实施流程,而非一句提示词即可完成的操作。
本文依次说明任务类型、技术路线、实施流程、实证证据与风险防控要点,供研究者参考。
二、任务类型辨析
选择技术方案之前,应首先明确研究任务所属的类型。四类任务的输出形式、前提条件与主要风险各不相同,见表 1。
表 1 大语言模型文本分析的四类任务
任务类型 | 典型问题 | 输出形式 | 是否需要编码本 | 主要风险 |
归类编码 | 该文本属于哪个类别?持何种立场? | 标签 | 需要 | 类别边界模糊导致系统性误判 |
信息抽取 | 文本涉及哪些主体、事件与时间? | 结构化字段 | 需要(先定义字段) | 生成原文中不存在的内容 |
归纳发现 | 语料中反复出现哪些议题维度? | 主题清单 | 不需要,但需人工确认 | 归纳结果缺乏针对性,流于泛化 |
解释生成 | 该文本为何应归入此类? | 自然语言理由 | 需要 | 理由属于事后建构,不必然反映真实依据 |
实践中最常见的误用,是将归纳发现当作归类编码处理:由模型直接输出主题并写入研究结论,而省略了人工核对环节。归纳所得应视为候选假设,须经文本验证与人工命名后方可使用。
三、技术路线及其适用情形
大语言模型并未使既有方法失效。词典法、监督学习、语义聚类与大语言模型各有适用条件,常见做法是将其组合使用。五条路线的对比见表 2。
表 2 文本分析技术路线对比
路线 | 代表方法 | 优势 | 局限 | 适用情形 |
词典法 | LIWC、自建领域词典 | 过程透明、可复现、成本低 | 无法处理否定与反讽 | 结论须完全可审计;长时段比较 |
词袋+监督学习 | 支持向量机等 | 有标注数据后成本低、结果稳定 | 需要数千条标注;跨领域泛化能力弱 | 已有大量历史标注,需处理全量数据 |
嵌入+聚类 | BERTopic(UMAP 降维、HDBSCAN 聚类、c-TF-IDF 主题表示)2 | 无需预设类别,对语义敏感 | 主题数量需调参,标签须人工拟定 | 探索阶段,尚不清楚语料包含哪些维度 |
大语言模型直接编码 | 零样本、少样本提示 | 无需训练数据,修订编码方案成本低 | 输出存在波动,成本随规模线性增长 | 编码方案尚在迭代,数据量中等 |
蒸馏 | 以大模型标注训练小模型 | 兼顾成本与稳定性 | 依赖大模型标注质量 | 数据量大,或需反复重跑 |
五条路线在研究流程中通常呈递进关系:探索阶段可采用 BERTopic 等聚类方法识别候选维度;编码方案确定后,采用大语言模型按编码本实施标注;数据规模较大或需重复执行时,再以蒸馏方式固化至小模型。
此外,Grimmer 与 Stewart 在 2013 年提出的四项原则,在当前技术条件下仍然适用:3
一、所有语言的量化模型都是错误的,但其中部分是有用的;二、量化方法放大并增强人类能力,而非取而代之;三、不存在普遍最优的文本分析方法;四、验证,验证,再验证。
四、实施流程
规范的实施流程包括六个环节。
(一)编制编码本
编码本是研究测量承诺的书面化:研究者据此声明所测量的概念。每个类别应至少包含四项内容:定义、纳入标准、排除标准、边界案例的判定规则。编制标准是:其他研究者依据编码本能够独立作出一致判断。
(二)构建人工金标准集
从语料中随机抽取 300—500 条文本,由至少两名编码员独立编码,并计算编码者间信度。信度指标推荐使用 Krippendorff's α(适用于多名编码员、多种测量尺度及缺失数据情形),两名编码员情形亦可使用 Cohen's κ。4 仅报告一致率是不充分的,该指标未扣除偶然一致的成分。
若人工编码员之间的信度未达标准,应首先修订编码方案,再考虑引入模型。按照 Krippendorff 提出的通行标准,α ≥ 0.800 方可用于可靠结论,0.667—0.800 之间仅可作暂定结论,低于 0.667 的数据应予弃用。16
(三)将编码本转写为机器可读的提示词
人工编码本不宜直接输入模型。Dunivin 2025 年发表于《EPJ Data Science》的研究表明:需针对机器理解重新转写编码描述,补全默认前提,将"视情况而定"的表述改为明确的判定规则,并写入边界案例;同时,要求模型以结构化格式输出、先陈述理由再给出标签(即思维链方式),可显著提高编码保真度。5
提示词可参照如下框架:
你是一名经过训练的内容分析编码员。
【任务】判断下面这段文本是否体现了「XXXX」。
【定义】XXXX 指的是……
【判为 1 的情况】
- ……
【判为 0 的情况】
- ……(注意:仅有……不足以判为 1)
【边界案例】
- 例 1:「……」→ 判 0,理由是……
- 例 2:「……」→ 判 1,理由是……
【输出要求】
先用不超过三句话陈述判断依据(须引用原文关键信息),再给出结论。
若信息不足以判断,label 输出 "unknown",不得猜测。
严格按以下 JSON 格式输出:
{"reason": "...", "label": 1}
【待编码文本】
"""
三项技术要点:其一,"信息不足不得猜测"须明确写入,否则模型倾向于强制给出答案;其二,要求引用原文,可抑制内容编造;其三,固定输出为 JSON,便于程序化处理。
(四)小样本试测与迭代
以金标准集对模型进行试测,重点考察各类别的召回率,而非仅看总体准确率。常见情形是:某一类别占比很小(如 5%),模型将其全部判入大类,总体准确率仍可达 95%,而该类别召回率为零。此类错误在已发表研究中并不罕见。
迭代对象包括三方面:编码本表述(修订后人工版应同步更新)、边界案例(将判错样本择要写入提示词)、类别划分方案本身(部分问题源于分类不合理而非模型能力)。
(五)全量执行与结果报告
正式执行后,研究报告中至少应包含以下验证结果:
1.相对人工金标准的分类精确率与召回率(分类别报告,不以总体准确率替代);
2.将模型视为第三名编码员计算的 Cohen's κ 或 Krippendorff's α;
3.混淆矩阵,用于定位系统性混淆的类别对;
4.unknown 输出的比例及其处理方式。
方法部分还应完整交代:模型名称与版本号、调用日期、提示词全文(可置于附录)、温度等参数设置、人工复核的比例与方式。上述信息缺一不可,否则结果无法复核。
(六)分歧处理与模型蒸馏
对 unknown 输出及模型与人工不一致的样本,应进行全量或抽样人工复核。数据规模较大或需反复执行时,可利用大语言模型标注结果微调小模型后处理全量数据。需要说明的是,Mellon 等人 2024 年的研究显示,在已有大量历史标注的场景下,监督模型(DistilRoBERTa,训练数据 57.6 万条)准确率为 77.8%,最优大语言模型少样本结果为 80.9%:大语言模型领先,但幅度有限,方案选择应结合数据规模权衡。6
五、实证证据
大语言模型文本分析的效果,已有若干可核查的实证研究。六项代表性研究的任务与结果见表 3。
表 3 代表性实证研究汇总
研究 | 任务 | 主要结果 |
Gilardi、Alizadeh 与 Kubli,2023,《PNAS》7 | 推文与新闻的标注任务(相关性、立场、主题、框架检测等),样本量 6,183 | 零样本 ChatGPT 准确率较众包工人平均高约 25 个百分点;编码者间一致性在全部任务上高于众包工人与受过训练的标注员;单条标注成本低于 0.003 美元,约为 MTurk 的三十分之一 |
Törnberg,2023,arXiv 预印本8 | 美国政客推文的党派归属分类 | GPT-4 的准确率与稳定性高于专家与众包编码员,偏差不高于人类 |
Mellon 等,2024,《Research & Politics》6 | 英国选举调查开放题归类,50 个类别 | 无训练数据情形:最优模型(Claude-1.3)93.9%,人类编码员 94.7%,最优监督模型 93.5%;已有历史标注情形:模型 80.9%,人类 88.6%,监督模型 77.8% |
Ziems 等,2024,《Computational Linguistics》9 | 13 个模型、25 个计算社会科学基准 | 分类任务上,零样本大语言模型未超过最优微调模型,但与人类具有基本一致性;生成式编码任务上,模型给出的理由质量常优于众包工人的参考答案 |
Dunivin,2025,《EPJ Data Science》5 | 人文社科段落级质性编码 | 保留编码本迭代流程、面向机器重写编码定义、结构化提示与思维链,可明显提高编码保真度 |
Yue 等,2025,《JMIR》10 | 中文访谈文本的扎根理论编码(GPT-4-Turbo) | 编码效率与多样性有所提升;在深度、语境把握、编码间关联与编码组织四方面弱于人工编码 |
依据上述证据,可形成三点判断:
第一,"大语言模型优于人类编码"是有条件的。有利条件为文本较短、类别界定清晰且无现成训练数据;当文本较长、判断依赖语境、或已有大量历史标注时,优势明显缩小,甚至发生逆转。Ziems 等的结论尤须注意:在标准分类基准上,零样本大语言模型未能超过最优微调模型。9
第二,大语言模型的合理定位是编码团队中的第二名编码员,而非人工编码的替代者。上述研究均未支持"全自动编码"的工作方式。
第三,中文语料与人文文本上的证据相对薄弱。现有研究绝大多数基于英文短文本。Baden 等人 2022 年指出,计算文本分析方法长期存在三个缺口:重技术而轻效度、聚焦单一内容抽取而社会科学需要测量复杂内容、工具链以英语为主导而限制了比较研究与非英语学界参与。11 其中第三点至今没有根本改变。据此,英文基准上的结论不宜直接推广至中文语料。
中文文献方面,林建浩、孙乐轩发表于《计量经济学报》2025 年第 1 期的综述,系统梳理了大语言模型在经济金融文本分析中的基本原理、应用场景与研究局限;12 龚为纲、黄思源发表于《求索》2025 年第 3 期的论文,讨论了大语言模型进入计算社会科学的工具、议题与挑战。13
六、主要风险与防控
(一)内容编造与强制作答
模型默认倾向给出确定答案,而非报告"信息不足"。防控措施:在提示词中明确"信息不足时输出 unknown";宁可损失部分样本,亦不应允许模型替代判断。
(二)系统性偏差
Zheng 等人 2023 年发表于 NeurIPS 的研究系统考察了"以模型为评判"的偏差类型:14
1.位置偏差:倾向选择先出现的选项。实测中 Claude-v1 有 75.0% 的判断偏向第一项,GPT-3.5 为 50.0%,GPT-4 为 30.0%;
2.冗长偏差:偏好更长的回答,即使内容冗余;
3.自我偏好:偏好与自身风格一致的答案。
防控措施:随机化选项顺序,或调换顺序重复判断;要求先陈述理由再输出标签;关键类别避免依赖单一模型。
(三)可复现性
需要特别说明:temperature 设为 0 并不保证输出完全一致。
Thinking Machines Lab 于 2025 年 9 月发布的实验显示:在 temperature 为 0 的条件下,对 Qwen3-235B-A22B-Instruct-2507 模型以同一提示采样 1,000 次(每次生成 1,000 个 token),得到 80 种不同输出,其中最常见的一种出现 78 次;全部输出的前 102 个 token 完全一致,分歧自第 103 个 token 开始。启用批不变(batch-invariant)算子后,1,000 次输出方才完全一致。15 其原因并非随机采样,而是浮点运算的执行顺序随服务器负载变化。
因此,实践中不应以"完全复现"为目标,而应以"可追溯、可追责"为目标,具体措施包括:
1.锁定具体模型版本号,不使用可能自动升级的别名;
2.保存每次请求的原始响应,连同时间戳与后端指纹(如 OpenAI 的 system_fingerprint 字段);
3.在论文中报告模型版本与调用日期;
4.对关键样本重复调用两至三次,报告结果稳定性。
(四)数据合规
访谈转录、未公开档案及含个人信息语料,不得上传至境外公开接口。人文社会科学研究尤须注意此项。替代方案为本地部署开源模型(如通义千问、DeepSeek 等开放权重模型,配合 Ollama、vLLM 等推理框架),确保数据不出校。本地部署可能带来编码质量下降,须以金标准集重新验证。
(五)将归纳结果直接作为结论
模型输出的主题清单属于候选假设,不属于研究结论。须回到文本中验证,主题命名须由研究者完成:主题的含义由研究者赋予,而非模型计算得出。
参考文献
1.Blei, D. M., Ng, A. Y., & Jordan, M. I. (2003). Latent Dirichlet Allocation. Journal of Machine Learning Research, 3, 993–1022.
2.Grootendorst, M. (2022). BERTopic: Neural topic modeling with a class-based TF-IDF procedure. arXiv preprint arXiv:2203.05794.
3.Grimmer, J., & Stewart, B. M. (2013). Text as Data: The Promise and Pitfalls of Automatic Content Analysis Methods for Political Texts. Political Analysis, 21(3), 267–297.
4.Hayes, A. F., & Krippendorff, K. (2007). Answering the Call for a Standard Reliability Measure for Coding Data. Communication Methods and Measures, 1(1), 77–89.
5.Dunivin, Z. O. (2025). Scaling hermeneutics: a guide to qualitative coding with LLMs for reflexive content analysis. EPJ Data Science, 14(1), 28.
6.Mellon, J., Bailey, J., Scott, R., Breckwoldt, J., Miori, M., & Schmedeman, P. (2024). Do AIs know what the most important issue is? Using language models to code open-text social survey responses at scale. Research & Politics, 11(1).
7.Gilardi, F., Alizadeh, M., & Kubli, M. (2023). ChatGPT outperforms crowd workers for text-annotation tasks. PNAS, 120(30), e2305016120.
8.Törnberg, P. (2023). ChatGPT-4 Outperforms Experts and Crowd Workers in Annotating Political Twitter Messages with Zero-Shot Learning. arXiv preprint arXiv:2304.06588.
9.Ziems, C., Held, W., Shaikh, O., Chen, J., Zhang, Z., & Yang, D. (2024). Can Large Language Models Transform Computational Social Science? Computational Linguistics, 50(1), 237–291.
10.Yue, Y., Liu, D., Lv, Y., Hao, J., & Cui, P. (2025). A Practical Guide and Assessment on Using ChatGPT to Conduct Grounded Theory: Tutorial. Journal of Medical Internet Research, 27, e70122.
11.Baden, C., Pipal, C., Schoonvelde, M., & van der Velden, M. A. C. G. (2022). Three Gaps in Computational Text Analysis Methods for Social Sciences: A Research Agenda. Communication Methods and Measures, 16(1), 1–18.
12.林建浩、孙乐轩(2025). 大语言模型与经济金融文本分析:基本原理、应用场景与研究展望. 《计量经济学报》, 5(1), 1–34.
13.龚为纲、黄思源(2025). 大语言模型与计算社会科学:工具、议题与挑战. 《求索》, 2025(3), 137–148.
14.Zheng, L., Chiang, W.-L., Sheng, Y., et al. (2023). Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. NeurIPS 2023 Datasets and Benchmarks Track. arXiv:2306.05685.
15.He, H., & Thinking Machines Lab. (2025 年 9 月 10 日). Defeating Nondeterminism in LLM Inference.
16.Krippendorff, K. (2019). Content Analysis: An Introduction to Its Methodology (4th ed.). SAGE Publications.