跳到正文
原文
Reddit r/LocalLLaMA (开源AI)· /u/SignificantZebra5883·· 2 小时前AI 评分51

作者将 LLM 蒸馏为两个 287M GLiNER 编码器做法律文书抽取,性能略低于教师模型

I Distilled an LLM into two 287M encoders (GLiNER + multiple choice) for document extraction, can't match teacher. did i do something wrong?

AI 导读

Reddit 用户为约 500 万份法院判决做结构化抽取,用 Claude Sonnet 标注约 700 份判决后蒸馏到两个 287M 模型:一个标注实体、动作和值的 span,一个做多项选择题式的实体归组和分类。推理在一张 RTX 5090 上约每秒 2.3 份判决,实体提及 F1 为 0.901,低于 LLM 自评的 0.935,作者在跑全量数据前公开完整配方征求改进建议。

来源:Reddit r/LocalLLaMA (开源AI) · reddit.com