2026年大语言模型分类难题有解!“弱”模型“想象”分类法更经济

发布时间:2026/8/16 16:50:58
2026年大语言模型分类难题有解!“弱”模型“想象”分类法更经济 请勿分类大胆想象到现在使用大语言模型LLM对产品、搜索查询等进行分类已经让人提不起兴趣了。而且要将 LLM 的输出限制在系统允许的品牌、颜色、类别等合法词汇范围内仍然颇具难度。以 Wayfair WANDS 电商数据集为例你需要将“木质咖啡桌”这样的查询语句归类到最合适的类别中。而这样的类别有数百个比如家具 / 办公家具 / 书桌家具 / 客厅家具 / 咖啡桌和边桌 / 咖啡桌家具 / 客厅家具 / 咖啡桌和边桌 / 边桌装饰与抱枕 / 装饰性抱枕和毛毯 / 靠枕家具 / 卧室家具 / 梳妆台和衣柜。传统的实现方法是采用结构化输出。你要告知模型其输出必须限制在合法值列表内。在 Pydantic 中你需要创建一个包含所有合法输出值的大型字面量。这种方法可行但使用小型“弱”模型进行大规模分类时有更经济的做法。幸运的是有一种简单的模式能让 LLM 分类变得相当顺畅。只需让一个“弱”LLM 为你的查询编造看似合理的虚假分类现在不再向 LLM 发送合法分类列表而是让它自由发挥想象。它会编造出一些在实际分类体系中并不存在的内容但实际上非常有帮助因为你现在可以将其转换为真正的词汇。构建一个包含真实分类嵌入的内存集成本并不高。你可以将这些“想象”任务交给“弱”且廉价的 LLM而且无需每次都向 LLM 发送分类模式。即将到来的活动向量周快来参加向量周活动吧这是一系列关于向量检索、混合搜索以及构建自己的向量数据库的活动。道格·特恩布尔Doug Turnbull可查看道格的更多内容。

相关新闻