news 2026/10/3 2:31:32

中文 Alpaca-Plus-7B / Plus-13B / 33B 在诗词、文学、哲学任务上的效果评测详解

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
中文 Alpaca-Plus-7B / Plus-13B / 33B 在诗词、文学、哲学任务上的效果评测详解
  • 大模型
  • 人工智能
  • 预训练
  • 微调
  • LoRA
  • 本地部署
  • NLP
  • 模型评测

【免费下载链接】Chinese-LLaMA-Alpaca

中文LLaMA&Alpaca大语言模型+本地CPU/GPU训练部署 (Chinese LLaMA & Alpaca LLMs)

项目地址:https://gitcode.com/gh_mirrors/ch/Chinese-LLaMA-Alpaca
点击查看免费下载

本篇技术指南基于 Chinese-LLaMA-Alpaca 项目公开的评测记录 examples/f16-p7b-p13b-33b/LITERATURE.md,围绕"诗词、文学、哲学"这一任务组,完整呈现中文 Alpaca-Plus-7B、Plus-13B 与 33B 三款指令模型的逐题打分与 20 道测试样例,并结合同目录效果对比说明与仓库推理脚本,解读评测方法、解码参数与复现路径。读完本文,你将了解这三款模型在文史哲领域的相对表现、主要失分点,以及如何在本地用相同参数复现此类单轮评测。

一、任务组背景:十组任务中的"诗词、文学、哲学"

"诗词、文学、哲学"(LITERATURE)是 examples/f16-p7b-p13b-33b/README.md 中十组对比任务中的一组,用于快速评测本项目的中文 Alpaca-Plus-7B、中文 Alpaca-Plus-13B、中文 Alpaca-33B 在同一组 Prompt 下的实际生成表现。该任务组共 20 个样例,覆盖古诗文接句、文学常识、作品出处、哲学思想、名著导读等典型中文知识问答场景,主要考验模型的中文文史哲知识记忆能力与事实准确性。

该对比评测的总体情况如下(摘自 examples/f16-p7b-p13b-33b/README.md):

测试任务详细样例样例数Alpaca-Plus-7BAlpaca-Plus-13BAlpaca-33B
💯总平均分-20075.379.4👍🏻82.0
知识问答QA.md2070.579.5👍🏻82.3
开放式问答OQA.md20👍🏻80.5👍🏻8078.5
数值计算、推理REASONING.md205161.5👍🏻84.5
诗词、文学、哲学LITERATURE.md2078.5👍🏻81.376
音乐、体育、娱乐ENTERTAINMENT.md2072.3👍🏻76.872.5
写信、写文章GENERATION.md2081👍🏻86.579
文本翻译TRANSLATION.md2086.889.3👍🏻92.3
多轮交互DIALOGUE.md2080.3👍🏻81.378
代码编程CODE.md2062.567.5👍🏻84.0
伦理、拒答ETHICS.md2089.890.5👍🏻92.5

可以看到:在本任务组上,Plus-13B 以 81.3 分领先,Plus-7B 以 78.5 分居中,33B 反而以 76 分垫底——这与 33B 在总平均分(82.0)上领先的整体趋势不同,说明模型能力在细分任务上存在明显差异,文史哲类知识问答并非 33B 的相对强项。需要注意,该组测试中 Alpaca-Plus-7B 与 Alpaca-Plus-13B 的结果沿用了之前的生成结果,33B 除多轮对话外的任务由 HuggingFace 原生接口解码(F16),多轮对话由 llama.cpp 解码(q4_0 量化版)。

二、逐题分数表与平均分解读

examples/f16-p7b-p13b-33b/LITERATURE.md 记录了三个模型在 20 个样例上的逐题打分(10 分制)与平均分,完整数据如下:

平均分#1#2#3#4#5#6#7#8#9#10#11#12#13#14#15#16#17#18#19#20
Plus-7B7.851010510510910697681010971051
Plus-13B8.125109510101061010979810788.51051
33B7.61010101051061010956810679371

几点解读:

  • 平均分换算关系:README 中该任务的 100 分制得分(78.5 / 81.3 / 76)与这里的 10 分制平均分(7.85 / 8.125 / 7.6)恰好是 10 倍关系(8.125×10 = 81.25 ≈ 81.3),印证了"样例得分之和规整到 100 分区间"的换算规则。
  • 满分样例集中:#1、#4、#6、#8、#14 五个样例(古诗接句、词义选择、作品列举、名著人物、诺贝尔奖常识)三个模型全部拿到 10 分满分,属于三款模型都能稳定答对的"安全区"。
  • 全部失分样例:#20("面朝大海,春暖花开"出处)三个模型全部只拿 1 分,是公认难点;#19(背诵《逍遥游》)三款模型得分也都不高(5 / 5 / 7),说明古文背诵类任务对这三个模型普遍困难。
  • 模型间差距最大的题目:#18(《基督山伯爵》作者)上 33B 仅得 3 分而另外两款得 10 分;#7(《红楼梦》台词出处)Plus-13B 与 33B 只得 6 分而 Plus-7B 得 9 分;#5("天时不如地利"出处)Plus-7B 与 33B 只得 5 分而 Plus-13B 得 10 分。

三、20 道测试样例完整呈现

以下为 examples/f16-p7b-p13b-33b/LITERATURE.md 中记录的 20 个 Prompt 及三个模型的原始生成回复(内容照原文档完整保留):

#PromptPlus-7BPlus-13B33B
1"白日依山尽"的下一句是什么?"黄河入海流"。"黄河入海流。""黄河入海流"。
2西游记中,唐僧的三个徒弟是谁?唐僧的三个徒弟是孙悟空、猪八戒和沙悟净。孙悟空、猪八戒、沙悟净。唐僧的三个徒弟分别是孙悟空、猪八戒和沙和尚。
3诗句"会当凌绝顶,一览众山小"出处是哪里?这首诗出自于唐代诗人王之涣的《登鹳雀楼》。这首诗出自唐代诗人王之涣的《登鹳雀楼》。这句诗出自唐代诗人杜甫的《登高》。
4"但愿人长久,千里共婵娟",其中婵娟指的是什么? A、月亮 B、姻缘A、月亮婵娟是指月亮。A、月亮
5"天时不如地利,地利不如人和"出自哪里?这句成语出自《论语·子罕》。这句话出自《孟子·公孙丑下》。这句话出自《战国策·齐策》。
6列举鲁迅的代表作都有哪些鲁迅是中国现代文学史上的重要人物,他的代表作有《狂人日记》、《阿Q正传》、《彷徨》、《孔乙己》等。鲁迅的代表作包括《狂人日记》、《阿Q正传》、《呐喊》、《彷徨》等。鲁迅的代表作有《狂人日记》、《阿Q正传》、《呐喊》、《彷徨》等。
7"不是东风压了西风,就是西风压了东风"一语是《红楼梦》中谁说的?这句话出自林黛玉的口中。这句话出自《红楼梦》的贾宝玉之口。这句话出自《红楼梦》第二十三回,是贾母对黛玉的一句话。
8莎士比亚的四大悲剧和喜剧包括什么?莎士比亚的四大悲剧是《哈姆雷特》、《奥赛罗》、《李尔王》和《麦克白》。他的四大喜剧是《威尼斯商人》、《仲夏夜之梦》、《第十二夜》和《皆大欢喜》。莎士比亚的四大悲剧包括《哈姆雷特》、《奥赛罗》、《李尔王》和《麦克白》。四大喜剧则包括《威尼斯商人》、《第十二夜》、《皆大欢喜》和《仲夏夜之梦》。莎士比亚的四大悲剧是《哈姆雷特》、《奥赛罗》、《李尔王》和《麦克白》。他的四大喜剧是《仲夏夜之梦》、《威尼斯商人》、《第十二夜》和《皆大欢喜》。
9欧亨利式结尾的特点是什么?欧亨利式结尾通常是开放式的,没有明确的结局或解决方法。这种结尾常常让读者自己去思考和想象故事中的角色和情节的发展。欧亨利式结尾是指在短篇小说或故事中,通过突然的转折或者意外结局来达到一种戏剧性效果。这种结尾通常是出乎意料的、令人惊讶的,并且往往带有讽刺意味。欧亨利式结尾是指故事或小说的结局,通常以一种出人意料的方式结束。这种结尾的特点是:
1. 意外性:故事的结局往往出乎读者的预料,让人感到惊喜和惊奇。
2. 讽刺意味:欧亨利式的结局常常带有一定的讽刺意味,揭示了现实生活中存在的问题和矛盾。
3. 寓意深刻:欧亨利式的结局往往具有深刻的寓意,能够引发读者对人生、社会等多个方面的思考。
4. 简洁明了:欧亨利式的结局通常比较简短,但又非常有力地表达了作者想要表达的思想。
10请你说出《静夜思》的作者和出处并且背诵全文。《静夜思》是唐代诗人李白所作,出自《全唐诗》卷一六五。全文如下:床前明月光,疑是地上霜;举头望明月,低头思故乡。《静夜思》是唐代诗人李白所作,出自《全唐诗》卷三百三十四。
床前明月光,疑是地上霜。
举头望明月,低头思故乡。
《静夜思》是唐代诗人李白所作,出自《李太白集》。全诗如下:床前明月光,疑是地上霜。举头望明月,低头思故乡。
11康德的主要哲学思想是什么?康德的主要哲学思想是批判唯心主义,强调人类认识能力的局限性,并提出了"纯粹理性"和"实践理性"的概念。他认为,我们只能通过经验来获得知识,而我们的认识能力受到感官经验、语言和概念等条件限制。因此,他主张通过逻辑推理和道德判断来确定正确的行为准则,以达到人类幸福和社会秩序的目的。康德的主要哲学思想是批判理性主义,即通过质疑和分析来获得知识。他强调人类的认识能力是有限的,因此我们不能直接感知到客观存在的事物,而只能通过推理和归纳来理解世界。他还提出了"纯粹理性"的概念,认为人类有天赋的能力去理解自然法则和道德原则。康德的主要哲学思想是批判性思维和道德哲学。他认为,人类的理性和自由是必要的,并且应该被尊重和保护。他提出了"自由意志"的概念,认为人们有能力做出自己的选择,并承担其后果。此外,他还强调了道德的重要性,认为每个人都应该遵循道德准则,以实现公正和平等的社会。
12维特根斯坦的"语言游戏"指的是什么?维特根斯坦的"语言游戏"是指一种哲学思想,认为语言本身是虚构的,并且我们所使用的语言只是符号系统,不能直接反映现实世界。因此,语言和符号系统本身就成为了一个游戏,人们在使用语言时需要遵循一定的规则和逻辑,才能够理解和表达自己的意思。维特根斯坦的"语言游戏"是指人类使用语言进行交流时所扮演的角色和互动方式。他认为,语言不仅仅是一种工具,而是一个复杂的系统,其中包含了各种不同的规则、意义和用途。通过对这些规则的理解,我们可以更好地理解语言的本质和功能。维特根斯坦的"语言游戏"是指人们使用语言来进行交流和表达思想的一种方式。他认为,语言并不是一种直接反映现实的方式,而是一种符号系统,它通过约定俗成的规则来构建出一种虚拟世界。因此,他提出了许多关于语言的本质、意义以及与现实的关系的问题。
13《时间简史》主要写的是什么?《时间简史》是英国物理学家史蒂芬·霍金所著的一本科普读物,主要讲述了宇宙学、相对论和量子力学等领域的知识。《时间简史》是一本关于宇宙起源、演化和未来的科普读物,作者是英国物理学家斯蒂芬·霍金。《时间简史》是英国物理学家斯蒂芬·霍金的一部科普读物,主要讲述了宇宙和时间的历史、演化以及人类对它们的认识。
14村上春树在哪一年获得了诺贝尔奖?村上春树从未获得过诺贝尔奖。村上春树并没有获得过诺贝尔奖。村上春树从未获得过诺贝尔奖。
15"学而时习之"下一句是什么?"不亦乐乎?""不亦悦乎?""不耻下问"。
16详细介绍一下《了不起的盖茨比》《了不起的盖茨比》是美国作家菲茨杰拉德于1925年出版的小说,讲述了一个关于爱情、财富和梦想的故事。故事发生在20世纪20年代的美国,主人公尼克·卡拉威(Nick Carraway)与他的邻居盖茨比(Jay Gatsby)成为了好朋友。
盖茨比是一个神秘的人物,他来自上流社会,拥有巨额财富和豪华的生活方式。然而,他一直追求着一个名叫黛西的女人,并试图通过各种手段让她爱上他。但最终,黛西选择了嫁给了有钱的汤姆·布坎南(Tom Buchanan)。
故事中还涉及到其他角色,如尼克的表妹黛西、盖茨比的朋友乔丹和汤姆的妻子凯瑟琳等。他们都对盖茨比产生了不同的看法,有些人认为他是一个好人,有些人则认为他是一个骗子。
小说通过描绘这些角色的生活和经历,探讨了财富、爱情、梦想和社会阶层的问题。它被誉为20世纪美国文学的经典之作,并成为了电影、舞台剧等艺术形式的灵感来源。
《了不起的盖茨比》是一本由美国作家F·斯科特·菲兹杰拉德所写的小说,于1925年出版。该书讲述了一个名叫杰伊·盖茨比的神秘富豪在20世纪20年代的纽约市追求他的旧爱黛西的故事。
故事主要围绕着盖茨比和他的邻居尼克·卡拉威展开,他们都对黛西产生了浓厚的感情。然而,黛西已经嫁给了另一个富有的人,而盖茨比则一直默默地守护着她。
小说通过对20世纪20年代的美国社会和文化进行描绘,展现了当时社会的浮华、虚荣和物质主义。同时,它也探讨了爱情、财富和社会阶层等主题,并提出了一些深刻的哲学思考。
《了不起的盖茨比》被认为是菲兹杰拉德最伟大的作品之一,也是美国文学史上的经典之作。
《了不起的盖茨比》是美国作家菲茨杰拉德创作的小说,讲述了20世纪20年代美国社会中一个富有而神秘的男人盖茨比的故事。小说通过对人物、情节和环境的描写,揭示出当时社会的种种矛盾和问题,并探讨了人性的本质。
17伏尔泰为什么说神圣罗马帝国"既不神圣,也不罗马,更非帝国"?伏尔泰认为神圣罗马帝国实际上是一个虚构的概念,它没有真正的权力和领土。他指出,这个国家是由多个独立的国家组成的,这些国家并没有真正意义上的统一。因此,他认为神圣罗马帝国是"既不神圣,也不罗马,更非帝国"。伏尔泰认为神圣罗马帝国不符合他所定义的神圣、罗马和帝国三个特征。他认为神圣是指宗教性质,而神圣罗马帝国并没有宗教地位;罗马是指罗马帝国的历史背景,但神圣罗马帝国与罗马帝国没有直接关系;帝国则是指具有统治权力的政权,但神圣罗马帝国在实际统治上并不具备这种权力。因此,伏尔泰认为神圣罗马帝国既不神圣,也不罗马,更非帝国。伏尔泰在《哲学史》中写道:"神圣罗马帝国既不神圣,也不罗马,更非帝国。"这句话是针对神圣罗马帝国的批评和讽刺。
首先,伏尔泰认为神圣罗马帝国并不神圣。他认为所谓的神圣罗马帝国实际上是一个世俗政权,其统治者并没有真正的宗教信仰和道德标准。其次,伏尔泰认为神圣罗马帝国并非真正的罗马帝国,因为罗马帝国已经灭亡了数百年,而神圣罗马帝国只是一个由法兰克人建立的政权,与古罗马帝国没有关系。最后,伏尔泰认为神圣罗马帝国也不是真正的帝国,因为它只是一个由多个小国组成的联邦体系,缺乏统一的政治、经济和文化。
总之,伏尔泰认为神圣罗马帝国并不是一个真正的神圣、罗马或帝国的国家,而是一个虚伪的政权,无法满足人们对于国家和社会的期望和要求。
18《基督山伯爵》是谁的作品?《基督山伯爵》是亚历山大·杜邦(Alexandre Dumas)的一部小说。《基督山伯爵》是法国作家亚历山大·杜马斯(Alexandre Dumas)的作品。《基督山伯爵》是法国作家维克多·雨果所写的一部长篇小说。
19请背诵庄子的《逍遥游》。庄子的《逍遥游》是一篇关于自由、无拘束和追求真理的哲学文章,其中提到了"吾生也有涯,而知也无涯",表达了对生命有限但智慧无限的思考。庄子曰:"夫子,人之所好者,莫若自由而已矣。"庄子曰:"吾生也有涯,而知也无涯。以有涯随无涯,殆已!"
20"面朝大海,春暖花开"出自哪里?这句诗出自鲁迅的《祝福》。这句诗出自唐代诗人李白的《望庐山瀑布》。这句话出自唐代诗人李白的《将进酒》。

四、样例观察:文史哲任务上的行为特征

基于上表的生成内容与打分,可以从数据层面观察到三款模型在该任务组上的一些行为特征(以下均为对表格内容的归纳,不代表对"正确答案"的额外判断):

  • 古诗文接句类表现稳定:#1("白日依山尽")三款模型均准确给出"黄河入海流",#10(《静夜思》背诵)三款模型均正确给出作者、出处与全文并获 9 分,说明高频经典诗文的记忆较为可靠。
  • "出处/作者"类题目是主要失分区:#3("会当凌绝顶"出处)、#5("天时不如地利"出处)、#18(《基督山伯爵》作者)、#20("面朝大海,春暖花开"出处)均有模型出现张冠李戴,其中 #20 三款模型全部答错、全部仅得 1 分。这类题目要求精确记忆,模型容易将相近的诗人、作品或书名混淆。
  • 文学常识列举类表现较好:#6(鲁迅代表作)、#8(莎士比亚四大悲剧与喜剧)三款模型均能完整列举并获得满分,说明高频文学常识覆盖面较好。
  • 开放式哲学/文学阐释类输出质量较高但评分波动:#9(欧亨利式结尾)、#11(康德思想)、#12(维特根斯坦"语言游戏")、#16(《了不起的盖茨比》介绍)、#17(伏尔泰评神圣罗马帝国)这类题目模型普遍能给出结构化的多要点回答,33B 在 #17 上得分最高(9 分),但在 #11 上却只有 5 分,说明开放式回答的得分受内容完整性、准确性与风格等因素综合影响。
  • 古文背诵类仍是短板:#19(背诵《逍遥游》)三款模型均未能完整背诵,得分仅为 5 / 5 / 7,反映模型对非高频长文记忆能力有限。
  • 严谨性不足体现在"一本正经地犯错":#7(《红楼梦》台词归属)三个模型给出了三个不同的"人物答案",#18 中 33B 将大仲马误答为雨果,这类"流畅但错误"的回答是该任务组低分的主要原因。

需要强调的是,这些分数是paired score(相对分数):即多个系统相互比较得到的相对结果,分数大小关系有一定参考价值,而绝对值意义有限;每个样例运行 2–3 次,人工选取最好的一组交给机器评分以降低随机性带来的偏差。

五、评测方法与解码参数

5.1 运行参数(llama.cpp 示例)

该组对比测试使用了统一的解码参数,examples/f16-p7b-p13b-33b/README.md 给出了 llama.cpp 的示例命令:

./main -m zh-alpaca-models/{Plus-7B,Plus-13B}/ggml-model-q8_0.bin --color -f ./prompts/alpaca.txt -ins \ -b 16 -c 2048 -n 512 -t 6 \ --temp 0.2 --top_k 40 --top_p 0.9 \ --repeat_penalty 1.1

参数要点说明:

参数取值作用
-mggml-model-q8_0.bin指定 8-bit 量化后的 GGML 模型文件(Plus-7B / Plus-13B 用 q8_0)
-ins-以指令理解/聊天模式启动(对应 Alpaca 指令模型)
-b 1616batch size
-c 20482048上下文长度(context size)
-n 512512生成的最大 token 数
-t 66线程数(多线程 CPU 推理)
--temp 0.20.2采样温度,较低以保证回答更确定
--top_k 4040top-k 采样
--top_p 0.90.9top-p(核)采样
--repeat_penalty 1.11.1重复惩罚系数

原文档特别注明:该组参数可能并不适合所有任务,实际使用时,对话、写作类等自由生成类任务可适当调高temp。换言之,文史哲知识问答偏向确定性回答,使用较低温度有助于抑制随机性、提升事实类题目的稳定性。

5.2 与 HuggingFace 推理脚本解码参数的一致性

该评测中 33B 的文史哲任务由 HuggingFace 原生接口以 F16 精度解码,仓库中的 scripts/inference/inference_hf.py 内置了与之对齐的生成配置(见该文件generation_config定义):

generation_config = dict( temperature=0.2, top_k=40, top_p=0.9, do_sample=True, num_beams=1, repetition_penalty=1.1, max_new_tokens=400 )

从源码结构看,这套配置与 llama.cpp 示例中的--temp 0.2 --top_k 40 --top_p 0.9 --repeat_penalty 1.1保持一致,max_new_tokens=400则对应 llama.cpp 的-n 512量级,说明两种推理后端在同一评测中保持了相近的解码策略。另外,该脚本针对 Alpaca 指令模型内置了与 llama.cpp 一致的 Prompt 模板(### Instruction:/### Response:),启动时需加--with_prompt参数自动套用模板。

5.3 打分方式

该任务组采用机器评分,规则与模板如下(摘自 examples/f16-p7b-p13b-33b/README.md):

  • 一共 10 组任务,每组任务满分 100 分;每组任务 20 个样例,每个样例满分 10 分;
  • 样例的得分之和规整到 100 分区间,作为该模型在该任务上的得分;
  • 使用 GPT-4 和 ChatGPT(GPT-3.5)对两个系统的输出进行打分(10 分制),优先使用 GPT-4;由于 GPT-4 的交互次数限制,一部分打分由 ChatGPT(gpt-3.5-turbo)进行;
  • 评分模板如下:
The followings are ChatGPT-like systems' outputs based on a single prompt. Please rate an overall score on a ten point scale for each system and give a short explanation to justify your scores. Please try not to give the same scores for different system unless they are indistinguishable. Prompt: <prompt-input> System1: <system1-output> System2: <system2-output>

需要说明的是,机器评分本身存在噪声(例如 #18 中 33B 将作者误答为雨果却仅得 3 分,而 Plus-7B 答"亚历山大·杜邦"获 10 分),因此该评测结果应视为相对参考而非绝对结论。

六、如何复现与扩展评测

如果你希望用相同参数复现"诗词、文学、哲学"类评测,可以按以下两种路径操作:

路径一:HuggingFace 原生接口(与 33B 评测一致)

先将 LoRA 权重与原版 LLaMA 合并(参考 README.md 的"合并模型"章节),然后准备一个每行一条指令的 Prompt 文件(如literature_prompts.txt),执行:

python scripts/inference/inference_hf.py \ --base_model <合并后的模型路径> \ --tokenizer_path <合并后的tokenizer路径> \ --data_file ./literature_prompts.txt \ --with_prompt \ --predictions_file ./literature_predictions.json \ --gpus 0

其中--with_prompt会自动为每条指令套用 Alpaca 的### Instruction:/### Response:模板;--predictions_file会把每条输入的完整 Prompt 与模型输出以 JSON 形式落盘,便于后续机器评分或人工核对。单条指令交互式问答可改用--interactive参数,并在--only_cpu下进行纯 CPU 推理。

路径二:llama.cpp(与 Plus-7B / Plus-13B 评测一致)

将合并后的模型转换为 GGML 格式并量化(如 q8_0),再使用 5.1 节给出的命令逐条(或通过-f指向批量 Prompt 文件)生成回复。

完成生成后,即可参照 5.3 节的模板组织"双系统对比打分",将多个模型的输出交给 GPT-4 / ChatGPT 按 10 分制评分并汇总。仓库中 examples/f16-p7b-p13b-33b/README.md 提供的其他任务组(如 QA.md、OQA.md、REASONING.md 等)也采用同一套样例数与打分框架,可整体复用此流程扩展评测规模。

七、评测局限与使用建议

综合 examples/f16-p7b-p13b-33b/README.md 与 examples/README.md 的说明,使用该评测结果时应注意以下边界:

  • 分数是相对值而非绝对值:paired score 只适合模型间横向比较,不应被解读为模型的绝对能力水平;
  • 生成具有随机性:回复受解码超参、随机种子等因素影响,虽然每个样例运行 2–3 次并人工挑选,仍存在波动;
  • 机器打分存在噪声:GPT-4 与 ChatGPT 混合打分、评分模板的措辞都会影响结果,个别样例的分数与人工直觉可能不符;
  • 不同任务组结论不同:33B 在总平均分上领先,但文史哲任务中 Plus-13B 表现最好,选型时应结合具体场景,在自身关注的任务上自行测试。

综上所述,本任务组给出了三款中文 Alpaca 模型在诗词、文学、哲学场景下的一份可复现的相对评测基线:Plus-13B 在该细分任务上综合最优(81.3),Plus-7B 次之(78.5),33B 相对落后(76);高频经典诗文与文学常识是模型的稳定得分点,而作品出处、作者归属与古文背诵是主要的失分短板。对于需要事实精确性的文史哲问答场景,建议在部署前结合上述解码参数与评测方法,对目标模型做针对性验证。

  • 大模型
  • 人工智能
  • 预训练
  • 微调
  • LoRA
  • 本地部署
  • NLP
  • 模型评测

【免费下载链接】Chinese-LLaMA-Alpaca

中文LLaMA&Alpaca大语言模型+本地CPU/GPU训练部署 (Chinese LLaMA & Alpaca LLMs)

项目地址:https://gitcode.com/gh_mirrors/ch/Chinese-LLaMA-Alpaca
点击查看免费下载

相关推荐

上一篇:在 Amazon SageMaker 上运行 MXNet:Estimator 训练与托管推理实战指南
下一篇:在 chezmoi 模板中使用 `gitHubTags` 获取 GitHub 仓库标签列表

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/3 2:30:56

Go 内存对齐与数据结构性能:字段顺序影响 50% 内存占用

Go 内存对齐与数据结构性能&#xff1a;字段顺序影响 50% 内存占用struct 字段顺序变了&#xff0c;内存占用也变了。写 Go 服务必须懂内存对齐规则&#xff0c;能让数据结构更紧凑。一、对齐基础 CPU 读内存一般按 8 字节对齐。如果 struct 内部字段顺序错乱&#xff0c;编译时…

作者头像 李华
网站建设 2026/10/3 2:30:53

蓝牙芯片驱动开发-第6章第5题-如何确保ACL数据包的正确识别与处理

蓝牙面试题解析:如何确保 ACL 数据包的正确识别与处理? 难度:⭐⭐⭐⭐ 较难 | 场景:社招二面/三面、蓝牙驱动开发 | 高频:🔥🔥🔥🔥 标准答案 ACL 数据包的识别与处理通过 类型标识 + 句柄匹配 + 完整性校验 + 缓冲管理 四层保障: ① 包类型识别(H4 传输层) …

作者头像 李华
网站建设 2026/10/3 2:30:23

京东云老用户主机续费省钱攻略:优惠活动全拆解

云主机续费这件事&#xff0c;一聊起来基本全是眼泪。新用户首年三折五折拿主机&#xff0c;看着挺香&#xff0c;可一到第二年续费&#xff0c;价格“duang”一下回到原价&#xff0c;账单直接翻倍甚至翻两倍。很多人就是被这一刀“劝退”的&#xff0c;干脆换一家重新“上车”…

作者头像 李华