朴素贝叶斯
统计各类标题中的词频,通过类别先验与平滑后的条件概率计算对数得分。
手写多项式 NB;单词级计数保留单字符词;在验证集选择平滑参数 α,并与 sklearn 核对相同输入的预测。
信息检索课程 · 项目二
比较朴素贝叶斯、Word2Vec+SVM、BERT+SVM 及 Tev1 微调前后的标题识别效果。
根据机器提取的标题文本,判断提取结果是否正确。
标题提取可能遗漏部分内容,也可能混入作者、刊名、页眉或正文。右侧样本的提取结果遗漏了原题名末尾的一部分内容。
本实验比较词频、Word2Vec 和 BERT 三类文本表示,以及 Tev1 零样本与任务微调两种决策设置。训练文件与测试表的标签统一映射为正确提取和提取错误。
实验样本加载中…
实验样本加载中…
训练数据依次剔除空行、类内重复、与测试标题重叠的记录及跨标签冲突记录。每条记录的来源与剔除原因均保存。
两类原始文件行数
空行、重复、重叠与冲突
独立标题身份
前三种方法的词表、词向量、标准化和分类器拟合训练部分。参数按验证集 Macro-F1 选择,配置固定后评估官方测试集。
前三种方法与 Tev1 微调沿用固定训练、验证划分,参数与检查点按验证集 Macro-F1 选择。第 04 项为 Ollama Q4_K_M 零样本,第 05 项为 NF4+QLoRA 任务微调,五种方法共用官方测试集。
统计各类标题中的词频,通过类别先验与平滑后的条件概率计算对数得分。
手写多项式 NB;单词级计数保留单字符词;在验证集选择平滑参数 α,并与 sklearn 核对相同输入的预测。
在训练标题上学习 100 维 Skip-gram 词向量,对已知词取均值,再使用线性 SVM 分类。
固定窗口 5、最小词频 2、10 轮训练和单 worker;未知词比例及全未知词标题逐分区记录。
冻结 BERT-base-uncased 编码器,使用 attention mask 排除 padding 与特殊 token,均值池化为 768 维标题向量。
固定模型版本;最大长度 64 tokens,记录截断比例。向量分块缓存后训练线性 SVM,C 值由验证集选择。
Tev1 基于 Qwen3.5-4B 监督微调,保留自回归输出头。第 04 项使用本机 Tev1-4B 的 GGUF/Q4_K_M 权重,通过 Ollama 0.35.0 的 System One 接口执行固定二分类任务。
模型读取机器提取标题,返回 valid、invalid 两类概率及所选类别。每条非空标题独立请求;原题名、文献 ID 与测试标签保留用于核对和评价。空标题沿用共同规则。
本项评价 Q4_K_M 部署下的零样本分类效果。运行记录保存 GGUF digest;该转换权重的上游 Hugging Face revision 记录缺失,第 05 项另行固定 Hugging Face 检查点版本。
在 Hugging Face 的 Tev1-4B-experimental 权重上进行 QLoRA 监督微调。Transformers 与 bitsandbytes 加载 NF4 四位量化主干并冻结,在文本模型的线性层训练 LoRA 适配器,秩为 8、缩放系数为 16。
输入由机器提取标题、固定分类说明和两个候选项组成,A 对应正确提取,B 对应提取错误。训练与推理共用非思考模式聊天模板;交叉熵损失覆盖答案字母及结束标记。
检查点依据验证集 Macro-F1 选择,随后评价完整官方测试集。同一模型实例关闭任务适配器后形成 Transformers NF4 零样本对照,量化、模板与评分程序保持一致,微调收益依据这组配对实验计算。
在官方测试集上比较五种方法。Precision、Recall 和 F1 以提取错误类为目标;Macro-F1 为两类 F1 的均值。
正在读取实验结果…
Tev1 任务微调:正在准备实验。
| 方法 | Precision | Recall | F1 | Macro-F1 | Accuracy |
|---|
点击单元格,查阅对应样本。
本节采用同一 Hugging Face Tev1-4B 检查点、NF4 四位量化和 Transformers 推理程序,共用非思考模式聊天模板与 A/B 选项评分。关闭或启用任务适配器后分别评价,衡量微调收益。
第 04 项采用 Ollama 0.35.0 与 GGUF/Q4_K_M;本节零样本对照采用 Transformers+bitsandbytes 与 NF4。测试样本、任务说明和空标题规则相同,输入模板与选项评分由各自的运行程序实现。两组零样本结果涉及多项部署配置变化,各因素贡献需要单因素对照实验确定。
| 设置 | Precision | Recall | F1 | Macro-F1 | Accuracy |
|---|
按模型误判、判断分歧或空标题筛选记录。点击标题可查看人工原题名及各模型预测。
预测标签:○ 正确提取,× 提取错误;赭红标记与真值不一致的预测。
对同一测试集的 1,000 条标题计算二维 t-SNE。NB 词频先经 TruncatedSVD 降至 50 维,Word2Vec 与 BERT 向量先经 PCA 降至 50 维,再分别计算嵌入坐标。
三组投影统一使用困惑度 30、随机种子 42、PCA 初始化与自动学习率,最多迭代 1,000 次。坐标计算使用标题特征,真实标签用于着色。图中邻近关系用于观察局部结构,分类效果依据测试集指标和混淆矩阵评价。
正在读取实验结果。
BERT 使用冻结编码器,未开展微调。输入上限为 64 tokens,测试集有 7 条记录发生截断。Word2Vec 标题向量采用已知词均值;测试词元中有 4.93% 属于未知词。两类训练文件按标题身份去重,高频重复标题的训练权重随之降低。
第 04 项评价 Tev1/Ollama Q4_K_M 零样本设置,类别概率、运行版本与逐条响应随实验保存。
Tev1 微调收益依据 Transformers NF4 零样本与 NF4+QLoRA 的配对结果计算,检查点依据验证集选择。
本报告的源码、数据、实验结果与复现材料可于 GitHub 项目仓库下载。
方法依据:scikit-learn / Gensim / BERT 模型卡 / t-SNE 实现 / System One 定义 / Tev1 模型卡 / Ollama 决策接口 / Tev1 训练指南 / QLoRA 实现。