基于国产开源基座 × LoRA 指令微调 × 新传高质量语料库 × RAG 检索增强
坚持“代码即真理”与“可复现实验”准则,全链路规范记录模型微调配方、检索底座与评测基准。
| 工程维度 | 核心参数与方案 | 学科适配与标准要求 |
|---|---|---|
| 基座模型 | 国产开源 Qwen/Qwen3-14B | 4,096 上下文窗口;LoRA rank=64, alpha=128,有效批次 32,混合精度微调。 |
| 正式试点配方 | 17 任务包 · 35,412 条高质量指令 | 新闻实务(18,292)、计算传播(7,276)、马新观(1,000)、真实教师批改脱敏(266)、实务改写与公关等。 |
| 知识库与检索 | 255,028 条党报篇章级精标切片 | BM25 词法与语义向量级联 RAG,端到端毫秒级检索,动态挂载篇名、版面、刊期与 11 种码本元数据。 |
| 评测与基准 | 冻结测试集 178 条(298 gold 字段) | 双通道复标(GPT-5.5 / GLM-5.2)+ 人工权威专家裁决(78:1 裁决存档),实施两臂对照严格评估。 |
| 部署与合规 | 本地私有化高性能算力部署 | 兼容 OpenAI 标准接口协议与 SSE 流式推送;严格执行四条学术合规红线,数据绝不出境。 |
本样机严格遵守《生成式人工智能服务管理暂行办法》及高校学术伦理规范。所有报刊语料均完成知识产权核查与版权合规梳理;学生实务习作批改数据经全流程脱敏;严禁编造学术引文与伪造报刊事实;坚决杜绝任何教学训练数据跨境传输。