信息检索课程 · 项目二

论文标题提取
错误识别。

比较朴素贝叶斯、Word2Vec+SVM、BERT+SVM 及 Tev1 微调前后的标题识别效果。

212,385清理后训练池
1,000官方测试记录
05分类方法
开始阅读
01

研究问题

根据机器提取的标题文本,判断提取结果是否正确。

标题提取可能遗漏部分内容,也可能混入作者、刊名、页眉或正文。右侧样本的提取结果遗漏了原题名末尾的一部分内容。

本实验比较词频、Word2Vec 和 BERT 三类文本表示,以及 Tev1 零样本与任务微调两种决策设置。训练文件与测试表的标签统一映射为正确提取和提取错误。

0:正确提取(Y)1:提取错误(N)
标题提取样本正在读取样本
机器提取标题

实验样本加载中…

人工提供原题名

实验样本加载中…

提取错误
02

数据与划分

训练数据依次剔除空行、类内重复、与测试标题重叠的记录及跨标签冲突记录。每条记录的来源与剔除原因均保存。

01 / 原始训练236,158

两类原始文件行数

02 / 清理与隔离23,773

空行、重复、重叠与冲突

03 / 固定训练池212,385

独立标题身份

固定划分

分层抽样,随机种子 42
169,908训练 / 80%
42,477验证 / 20%
官方测试集1,000正确 568 / 错误 432

前三种方法的词表、词向量、标准化和分类器拟合训练部分。参数按验证集 Macro-F1 选择,配置固定后评估官方测试集。

编码与身份
GB18030 严格解码;NFKC、casefold 与空白合并用于标题身份检查。
标签冲突
2,965 个标题身份在训练文件中出现相反标签,统一隔离。
测试集保留
全部 1,000 个文献 ID 保留;24 条空标题单列评价,13 条非空重复按各自 ID 计分。
查看清理计数与数据版本 +

处理数据指纹

数据加载中

原始文件、划分与处理后数据均保存 SHA-256;训练/验证/测试标题身份隔离已核验。

下载数据材料 ↗
03

分类方法

前三种方法与 Tev1 微调沿用固定训练、验证划分,参数与检查点按验证集 Macro-F1 选择。第 04 项为 Ollama Q4_K_M 零样本,第 05 项为 NF4+QLoRA 任务微调,五种方法共用官方测试集。

标题分类流程
机器提取标题
朴素贝叶斯
词频计数多项式 NB
Word2Vec+SVM
100 维均值向量线性 SVM
BERT+SVM
768 维池化向量线性 SVM
Tev1/Q4_K_M 零样本
固定决策任务预训练权重
Tev1+QLoRA
标签监督微调任务适配器
正确提取提取错误
01

朴素贝叶斯

统计各类标题中的词频,通过类别先验与平滑后的条件概率计算对数得分。

手写多项式 NB;单词级计数保留单字符词;在验证集选择平滑参数 α,并与 sklearn 核对相同输入的预测。

log P(c) + Σ count(w) · log P(w | c)
02

Word2Vec+SVM

在训练标题上学习 100 维 Skip-gram 词向量,对已知词取均值,再使用线性 SVM 分类。

固定窗口 5、最小词频 2、10 轮训练和单 worker;未知词比例及全未知词标题逐分区记录。

token → word vector → mean → LinearSVC
03

BERT+SVM

冻结 BERT-base-uncased 编码器,使用 attention mask 排除 padding 与特殊 token,均值池化为 768 维标题向量。

固定模型版本;最大长度 64 tokens,记录截断比例。向量分块缓存后训练线性 SVM,C 值由验证集选择。

title → BERT → masked mean → LinearSVC
04

Tev1/Ollama Q4_K_M 零样本

Tev1 基于 Qwen3.5-4B 监督微调,保留自回归输出头。第 04 项使用本机 Tev1-4B 的 GGUF/Q4_K_M 权重,通过 Ollama 0.35.0 的 System One 接口执行固定二分类任务。

模型读取机器提取标题,返回 valid、invalid 两类概率及所选类别。每条非空标题独立请求;原题名、文献 ID 与测试标签保留用于核对和评价。空标题沿用共同规则。

本项评价 Q4_K_M 部署下的零样本分类效果。运行记录保存 GGUF digest;该转换权重的上游 Hugging Face revision 记录缺失,第 05 项另行固定 Hugging Face 检查点版本。

title → Ollama System One → P(valid), P(invalid)
05

Tev1 任务微调

在 Hugging Face 的 Tev1-4B-experimental 权重上进行 QLoRA 监督微调。Transformers 与 bitsandbytes 加载 NF4 四位量化主干并冻结,在文本模型的线性层训练 LoRA 适配器,秩为 8、缩放系数为 16。

输入由机器提取标题、固定分类说明和两个候选项组成,A 对应正确提取,B 对应提取错误。训练与推理共用非思考模式聊天模板;交叉熵损失覆盖答案字母及结束标记。

检查点依据验证集 Macro-F1 选择,随后评价完整官方测试集。同一模型实例关闭任务适配器后形成 Transformers NF4 零样本对照,量化、模板与评分程序保持一致,微调收益依据这组配对实验计算。

title → Tev1+LoRA → P(valid), P(invalid)
04

实验结果

在官方测试集上比较五种方法。Precision、Recall 和 F1 以提取错误类为目标;Macro-F1 为两类 F1 的均值。

正在读取实验结果…

Tev1 任务微调:正在准备实验。

下载结果 JSON ↗
各模型测试指标;Precision、Recall、F1以错误类为目标
方法PrecisionRecallF1Macro-F1Accuracy

混淆矩阵

行 / 真值 列 / 预测

点击单元格,查阅对应样本。

朴素贝叶斯

配置与复现信息 +
05

样本核对

按模型误判、判断分歧或空标题筛选记录。点击标题可查看人工原题名及各模型预测。

全部测试记录
文献 / 标题真值NBW2VBERTQ4微调

预测标签:○ 正确提取,× 提取错误;赭红标记与真值不一致的预测。

06

t-SNE 特征可视化

对同一测试集的 1,000 条标题计算二维 t-SNE。NB 词频先经 TruncatedSVD 降至 50 维,Word2Vec 与 BERT 向量先经 PCA 降至 50 维,再分别计算嵌入坐标。

三组投影统一使用困惑度 30、随机种子 42、PCA 初始化与自动学习率,最多迭代 1,000 次。坐标计算使用标题特征,真实标签用于着色。图中邻近关系用于观察局部结构,分类效果依据测试集指标和混淆矩阵评价。

t-SNE 数据加载中点击核对 / 拖动框选
07

结果讨论

正在读取实验结果。

实验设置

BERT 使用冻结编码器,未开展微调。输入上限为 64 tokens,测试集有 7 条记录发生截断。Word2Vec 标题向量采用已知词均值;测试词元中有 4.93% 属于未知词。两类训练文件按标题身份去重,高频重复标题的训练权重随之降低。

第 04 项评价 Tev1/Ollama Q4_K_M 零样本设置,类别概率、运行版本与逐条响应随实验保存。

Tev1 微调收益依据 Transformers NF4 零样本与 NF4+QLoRA 的配对结果计算,检查点依据验证集选择。

本报告的源码、数据、实验结果与复现材料可于 GitHub 项目仓库下载。

标题核对

机器提取标题

人工提供原题名

SVM 边距大于 0 对应错误类;NB 展示错误类模型概率。空标题通过共同规则判定。