简介:这份资源是面向计算机相关专业学生的中文垃圾短信识别毕业设计项目,基于Python实现,核心亮点在于手写分类器,适合正在做大作业、课程设计或期末项目、需要实战练习的学习者参考。项目经导师指导并认可,评审分99分,代码完整可运行,对新手较为友好。压缩包共23个文件,约47.94MB,以12个py源码文件为主,涵盖分词、模型管理与测试脚本,另有7个pkl模型文件保存逻辑回归、朴素贝叶斯、感知机等训练结果,以及2个txt短信数据集、1个md说明文档和1个gitignore配置。资源完整呈现了从数据读取、特征处理到多分类器训练与评估的流程,读者可借此理解文本分类的基本思路,对照源码复现实验,并在此基础上调整模型或替换数据集,完成自己的设计任务。目前已有52人学习下载。
1. 拆开这份中文垃圾短信识别源码:手写分类器到底能不能跑通
短信过滤这件事,很多人第一反应是调个现成接口,可真到毕业设计答辩现场,老师问一句「朴素贝叶斯里拉普拉斯平滑加在哪一行」,接口方案就露馅了。这份基于 Python 的中文垃圾短信识别源码,走的是另一条路——把逻辑回归、朴素贝叶斯、感知机三个分类器全部手写实现,再配一套 jieba 分词加 TF-IDF 向量化的完整流程,最后用 sklearn 版本做对照验证。它解决的不是「能不能分类」的问题,而是「你能不能讲清楚每一行代码在干什么」的问题。适合正在做计算机相关毕业设计、课程设计,或者想拿一个完整 NLP 小项目练手的人。整个包不大,但结构清晰,从数据读取到模型持久化都有对应文件,拿来就能跑,改起来也有抓手。
2. 数据管道与分词:从原始短信到 TF-IDF 向量
2.1 带标签与不带标签短信的读取逻辑
拿到数据第一步不是急着上模型,而是先看清楚数据长什么样。包里有两个数据文件:带标签短信.txt和不带标签短信.txt。带标签的用于训练和评估,不带标签的用于实际预测演示。常见做法是每行一条短信,标签和内容之间用制表符或特定分隔符隔开,读取时按行切分。
# 读取带标签短信,假设格式为 "标签\t短信内容" def load_labeled_data(filepath): texts, labels = [], [] with open(filepath, 'r', encoding='utf-8') as f: for line in f: line = line.strip() if not line: continue parts = line.split('\t') if len(parts) < 2: continue label, content = parts[0], parts[1] labels.append(int(label)) texts.append(content) return texts, labels这段代码的关键在于容错:空行跳过、字段不足跳过。实际数据里经常混入空行或者分隔符不一致的行,如果不做判断,后面分词阶段直接报错。参数上,encoding='utf-8'是必须的,中文短信如果用 gbk 读会乱码。标签一般用 0 和 1 表示,0 是正常短信,1 是垃圾短信,具体哪个对应哪个要看数据文件里的实际标注,建议先打印前几行确认。
2.2 jieba 分词与停用词处理
中文和英文不一样,英文按空格切就行,中文必须分词。包里test_jieba.py就是干这个的。jieba 有三种模式:精确模式、全模式、搜索引擎模式。短信这种短文本,精确模式最合适,全模式会把「中国人」切成「中国」「国人」「中国人」,噪声太大。
import jieba def tokenize(text): # 精确模式分词,过滤掉单字和空白 words = jieba.lcut(text, cut_all=False) return [w for w in words if len(w) > 1 and w.strip()]这里我一般会加一个停用词表过滤,但这份源码里没有单独提供停用词文件,所以用「长度大于 1」作为最简单的过滤条件。为什么过滤单字?因为「的」「了」「是」这类单字对分类几乎没有区分度,反而增加维度。如果你要自己加停用词,可以在项目根目录放一个stopwords.txt,每行一个词,然后在tokenize里加一层判断。注意 jieba 第一次运行会构建缓存,速度稍慢,第二次就快了,这不是卡死。
2.3 TF-IDF 向量化与 vsm.pkl 的生成
分词之后是向量化。包里token_and_save_to_file.py负责把分词结果转成 TF-IDF 向量,并保存为vsm.pkl。VSM 就是向量空间模型,每个短信变成一个高维向量,每一维对应一个词的权重。
from sklearn.feature_extraction.text import TfidfVectorizer import pickle def build_vsm(texts, save_path='model/vsm.pkl'): vectorizer = TfidfVectorizer(tokenizer=lambda x: x, preprocessor=None, token_pattern=None) # 注意:这里传入的 texts 应该是已经分好词的列表 tfidf_matrix = vectorizer.fit_transform(texts) with open(save_path, 'wb') as f: pickle.dump(vectorizer, f) return tfidf_matrix, vectorizer参数说明:tokenizer=lambda x: x表示不再分词,因为传进来的已经是词列表;token_pattern=None关闭默认的正则匹配,否则 sklearn 会按空格再切一次。这个坑很隐蔽——如果你直接传原始中文句子给 TfidfVectorizer,它会把整句当一个词,因为默认 token_pattern 不识别中文。所以必须先分词再向量化。保存vsm.pkl的目的是预测时用同一个向量空间,不然维度对不上,模型直接报错。
3. 三个手写分类器的实现细节与训练入口
3.1 手写朴素贝叶斯:拉普拉斯平滑与对数概率
NaiveBayesian.py是三个手写分类器里最值得细看的一个。朴素贝叶斯的核心是贝叶斯定理加特征独立假设,但实际写的时候有两个关键点:拉普拉斯平滑和对数概率。
import numpy as np class NaiveBayesian: def __init__(self, alpha=1.0): self.alpha = alpha # 拉普拉斯平滑系数 self.class_prior = {} self.word_prob = {} def train(self, X, y): classes = np.unique(y) for c in classes: X_c = X[y == c] self.class_prior[c] = np.log(len(X_c) / len(y)) # 统计每个词在该类中的出现次数 word_count = X_c.sum(axis=0) + self.alpha total = word_count.sum() self.word_prob[c] = np.log(word_count / total) def predict(self, X): preds = [] for x in X: scores = {} for c in self.class_prior: scores[c] = self.class_prior[c] + (x * self.word_prob[c]).sum() preds.append(max(scores, key=scores.get)) return np.array(preds)逻辑说明:alpha=1.0就是拉普拉斯平滑,防止某个词在某个类别里没出现过导致概率为 0,取对数后变成负无穷。用对数概率而不是原始概率,是因为很多个小概率相乘会下溢变成 0。参数上,alpha可以调,一般取 1.0,数据量大时可以调小到 0.1。注意这里的X是 TF-IDF 矩阵,不是词频矩阵,所以word_count实际上是权重求和,严格来说不是标准的多项式朴素贝叶斯,但效果通常够用。
3.2 手写逻辑回归:梯度下降与学习率
LogisticRegression.py用的是批量梯度下降。逻辑回归的预测函数是 sigmoid,损失函数是对数似然。
class LogisticRegression: def __init__(self, lr=0.01, epochs=1000): self.lr = lr self.epochs = epochs self.weights = None self.bias = None def sigmoid(self, z): return 1 / (1 + np.exp(-np.clip(z, -250, 250))) def train(self, X, y): n_samples, n_features = X.shape self.weights = np.zeros(n_features) self.bias = 0 for _ in range(self.epochs): linear = X.dot(self.weights) + self.bias y_pred = self.sigmoid(linear) dw = (1 / n_samples) * X.T.dot(y_pred - y) db = (1 / n_samples) * np.sum(y_pred - y) self.weights -= self.lr * dw self.bias -= self.lr * db参数说明:lr是学习率,默认 0.01,太大容易震荡不收敛,太小收敛慢。epochs是迭代次数,1000 次对短信数据量一般够用。np.clip(z, -250, 250)是防止 exp 溢出,这是血泪经验——如果不加,当 z 很大或很小时会报 overflow 警告,虽然不影响结果但看着难受。注意这里的 X 是稀疏矩阵还是稠密矩阵会影响速度,TF-IDF 矩阵通常很稀疏,建议用scipy.sparse存储,但这份源码里用的是 numpy 数组,数据量不大时没问题。
3.3 手写感知机与 sklearn 对照:model_manage.py 的统一调度
Perceptron.py是最简单的线性分类器,更新规则是误分类点驱动。model_manage.py则是统一入口,负责训练、保存、加载模型。包里model/目录下已经有训练好的 pkl 文件,包括Perceptron.pkl、LogisticRegression.pkl、NaiveBayesian.pkl,还有 sklearn 版本的Logistic_sklearn.pkl、Bayes_sklearn.pkl、SVM_sklearn.pkl。
import pickle from classifier.NaiveBayesian import NaiveBayesian from classifier.LogisticRegression import LogisticRegression from classifier.Perceptron import Perceptron def train_and_save(model_name, X_train, y_train, save_path): if model_name == 'nb': model = NaiveBayesian() elif model_name == 'lr': model = LogisticRegression() elif model_name == 'perceptron': model = Perceptron() model.train(X_train, y_train) with open(save_path, 'wb') as f: pickle.dump(model, f) return model逻辑说明:这里用字典映射或者 if-else 来切换模型,保存时用 pickle。注意 pickle 保存的是整个对象,包括类定义所在的模块路径,所以加载时项目目录结构不能变,否则会报ModuleNotFoundError。这也是为什么包里classifier/目录不能随便改名。sklearn 版本的模型保存方式类似,但加载后直接调predict就行,不用自己写预测逻辑。
4. 避坑与排查:跑这份源码时最容易翻车的五个地方
4.1 现象:运行 test.py 报「No module named classifier」
原因:Python 导入路径问题。项目根目录下虽然有classifier/文件夹,但如果你在子目录里运行脚本,或者 IDE 的工作目录设错了,Python 找不到这个包。
解决:在项目根目录下运行脚本,或者手动把根目录加到sys.path里。常见做法是在脚本开头加import sys; sys.path.append('.'),但更稳妥的是用python -m test这种方式运行,让 Python 把当前目录当作包根。
4.2 现象:jieba 分词后 TF-IDF 矩阵维度对不上,预测时报 shape 错误
原因:训练时用的vsm.pkl和预测时重新 fit 的 vectorizer 不是同一个。TF-IDF 的维度取决于训练语料里出现的词,如果预测时重新 fit,词表变了,维度自然对不上。
解决:预测时必须加载训练时保存的vsm.pkl,用vectorizer.transform()而不是fit_transform()。包里test_judge.py和judgeSpamMessage.py就是干这个的,确保它们加载的是同一个 vsm 文件。
4.3 现象:朴素贝叶斯预测结果全是同一类
原因:拉普拉斯平滑系数太小,或者某个类的先验概率被 log 后变成负无穷。如果训练数据极度不平衡,比如垃圾短信只占 1%,先验概率取 log 后很小,加上词概率后仍然偏向多数类。
解决:检查alpha参数,适当调大;或者对训练数据做重采样。另外确认标签编码是否正确,如果标签是字符串而不是 0/1,np.unique后可能出问题。
4.4 现象:pickle 加载模型时报「Can't get attribute 'NaiveBayesian' on module 'main'」
原因:保存模型时,类定义在__main__里,加载时找不到。这通常是因为你在交互式环境里训练并保存,然后换了个脚本加载。
解决:确保训练和加载用的是同一套代码结构,类定义在独立的.py文件里,不要直接在命令行里定义类再保存。包里classifier/目录下的文件就是正确做法。
4.5 现象:sklearn 版本模型预测结果和手写版本差距很大
原因:手写版本和 sklearn 版本的默认参数不同。比如 sklearn 的 LogisticRegression 默认有正则化,手写版本没有;sklearn 的 MultinomialNB 默认 alpha=1.0,手写版本可能设了别的值。
解决:对照 sklearn 文档,把手写版本的参数调到和 sklearn 一致,或者反过来。如果只是做毕业设计演示,差距在 5% 以内可以接受,但要在文档里说明原因。
5. 从跑通到讲清楚:用 test_judge2.py 做单条预测与结果解读
5.1 单条短信预测的完整调用链
test_judge2.py和judgeSpamMessage.py是实际预测入口。前者可能是批量测试,后者是单条判断。以单条为例,完整流程是:读入短信 → jieba 分词 → 加载 vsm.pkl 做 transform → 加载模型 pkl → predict → 输出标签。
import pickle import jieba from classifier.NaiveBayesian import NaiveBayesian def judge_one(text, model_path='model/NaiveBayesian.pkl', vsm_path='model/vsm.pkl'): with open(vsm_path, 'rb') as f: vectorizer = pickle.load(f) with open(model_path, 'rb') as f: model = pickle.load(f) words = [w for w in jieba.lcut(text) if len(w) > 1] vec = vectorizer.transform([' '.join(words)]) pred = model.predict(vec.toarray()) return '垃圾短信' if pred[0] == 1 else '正常短信'逻辑说明:vectorizer.transform接收的是字符串列表,所以要把分词结果用空格 join 回去。vec.toarray()是因为手写模型用的是 numpy 数组,不接受稀疏矩阵。如果换成 sklearn 模型,可以直接传稀疏矩阵。参数上,model_path和vsm_path要对应,不能混用不同训练轮次的文件。
5.2 结果解读与置信度输出
手写朴素贝叶斯和逻辑回归都可以输出概率,但这份源码里predict只返回标签。如果你想在答辩时展示置信度,可以改一下predict方法,返回scores或者 sigmoid 输出。
# 以朴素贝叶斯为例,修改 predict 返回概率 def predict_proba(self, X): probs = [] for x in X: scores = {} for c in self.class_prior: scores[c] = self.class_prior[c] + (x * self.word_prob[c]).sum() # 转成概率 max_score = max(scores.values()) exp_scores = {c: np.exp(s - max_score) for c, s in scores.items()} total = sum(exp_scores.values()) probs.append({c: v / total for c, v in exp_scores.items()}) return probs这段代码用 log-sum-exp 技巧把对数概率转回概率,避免溢出。答辩时如果能展示「这条短信有 87% 概率是垃圾短信」,比只输出一个标签更有说服力。注意max_score的减法是为了数值稳定,不影响最终概率比例。
5.3 模型对比与选型建议
包里提供了手写和 sklearn 两套模型,实际用的时候怎么选?如果是毕业设计,建议以手写版本为主,sklearn 版本作为对照。手写版本能体现你对算法原理的理解,sklearn 版本能证明你的结果不是瞎编的。从效果上看,朴素贝叶斯在短信分类上通常表现不错,因为短信短、特征稀疏,朴素贝叶斯的独立性假设反而没那么致命。逻辑回归和感知机在线性可分数据上表现接近,但感知机对学习率更敏感。
| 模型 | 优点 | 缺点 | 适用场景 |
|---|---|---|---|
| 手写朴素贝叶斯 | 原理清晰,训练快 | 特征独立假设强 | 短文本分类 |
| 手写逻辑回归 | 可输出概率,可解释 | 需要调学习率 | 二分类基线 |
| 手写感知机 | 实现最简单 | 对噪声敏感 | 教学演示 |
| sklearn 版本 | 稳定,参数多 | 黑盒感强 | 对照验证 |
从那以后我每次带学生做这类项目,都强制要求先跑通手写版本,再用 sklearn 对照,最后把两个版本的预测结果差异逐条分析一遍。这样答辩时不管老师问哪个细节,都能接得住。希望帮到你。
本文还有配套的精品资源,点击获取