AI资讯ai-models
13B,用 ShareGPT 对话微调 LLaMA,训练成本约 $300
核心亮点
Vicuna 是 LMSYS(Chatbot Arena 团队)在 2023 年推出的开源对话模型,基于 LLaMA-13B 微调而来。它的成名点在于:用从 ShareGPT 收集的多轮对话数据训练,整体成本仅约 300 美元,却在多项评测中逼近 ChatGPT 的表现,第一次让"平民级"训练成为可能,引爆了开源对话模型的热潮。
具体能力
Vicuna 主打多轮对话质量。训练数据来自用户真实分享的 ChatGPT 对话,覆盖大量长上下文、复杂指令场景,使模型在连贯性、指令遵循和角色扮演上明显强于早期的 Alpaca、LLaMA 原生版本,对话体验更自然,也更少出现"忘记上文"的问题。
技术细节
训练采用标准的监督微调(SFT),在 8×A100 上约数小时完成;关键不在算法多新颖,而在数据质量与多轮格式。LMSYS 同时发布了基于 GPT-4 的自动评测流程,用模型给模型打分,这一做法后来被广泛沿用,成为开源评测的标配思路,也催生了一整条评测工具链。
与竞品对比
相比同期的 Alpaca(仅单轮指令)、Koala,Vicuna 凭借多轮对话数据在体验上更自然;相比闭源 ChatGPT,它用约 1/1000 的成本证明了"开源小模型 + 好数据"的潜力,成为开源社区的重要里程碑,也是后续众多中文对话模型与本地部署方案的起点。
行业影响
Vicuna 降低了"做出能用的对话模型"的门槛,直接催生了后续一系列开源微调模型与本地部署热潮。说白了,它让很多人第一次意识到:不用 OpenAI,也能跑起一个像样的聊天模型。如今它更多作为历史节点被引用,但其数据与方法论影响延续至今,仍是研究开源演进的重要案例。