文章总结与翻译
一、文章主要内容
本文聚焦于为代表性不足的语言(以土耳其语为例)和金融特定任务适配开源大型语言模型(LLM),提出了TULIP模型系列,具体内容如下:
- 研究背景:金融领域对LLM应用需求迫切,但现有大型专有模型存在“黑箱”特性,且小型模型在金融领域及土耳其语等小众语言上能力不足,同时金融数据敏感、土耳其语存在形态复杂、借词多等语言特性,进一步增加了LLM应用难度。
- 模型开发:以Llama 3.1 8B和Qwen 2.5 7B为基础模型,通过五阶段开发流程构建TULIP模型:
- 数据收集:筛选高质量金融领域数据,涵盖学术来源、金融机构资料、教材等多类别,同时针对监督微调阶段,利用更强大的LLM(GPT-4o)生成包含多种任务类型(如选择题、总结、填空题等)的合成数据集。
- 持续预训练(CPT):采用QLoRA高效微调技术,设置学习率2e-5,使用paged adamw 8bit优化器,以bf16混合精度训练,处理约21.9亿个token,生成TULIP-Llama-3.1和TULIP-Qwen2.5模型。
- 基准设计:构建两个金融领域基准数据集,一是FINTREXAMS(土耳其语金融多 choice 数据集,涵盖7个金融子领域),二是土耳其贸易登记公报数据集(含880个人工标注问答对)。
- 合成数据生成:基于学术、
订阅专栏 解锁全文

235

被折叠的 条评论
为什么被折叠?



