Darwin(自然科学大模型)

专为物理、化学和材料科学打造的开源大语言模型,整合科学知识实现材料设计、科学问答和数据分析,性能超越GPT-4。

coding 🆓 免费 🔓 开源
✨ 基于LLaMA的开源科学大模型✨ 材料自我设计与逆向预测✨ 科学问答超越GPT-4✨ 独创SIG自动化指令生成✨ 多任务学习提升泛化能力
🌐 访问官网 →

产品概述

Darwin模型是由新南威尔士大学ai4Science团队与GreenDynamics AI合作开发的开源大语言模型,专门服务于自然科学领域。它基于LLaMA架构,通过融合结构化和非结构化的科学知识,提升模型在科学研究中的有效性。最新版本Darwin 1.5进一步增强了材料科学方面的能力,采用两阶段训练策略(QA微调+多任务学习)和LIFT微调框架,使处理复杂科学问题时更高效灵活。

核心优势

**多学科融合能力**:Darwin整合了物理、化学、材料科学的领域知识,能处理跨学科复杂任务。它并非简单的问答机器,而是能够理解科学概念间的内在联系,为研究人员提供精准支持。 **科学指令生成(SIG)**:独创的自动化科学文本指令数据生成技术,大幅减少对人工标注和领域知识图谱的依赖,显著提升模型训练效率和准确性。配合多任务学习策略,Darwin能够揭示不同科学任务之间的共性,增强泛化能力。 **性能超越闭源模型**:在科学问答和化学问题解决任务中,仅7B参数的Darwin模型表现优于GPT-4和微调后的GPT-3.5。在MatBench材料科学基准上,它在实验带隙预测和金属分类任务中取得SOTA成绩,甚至超过专用机器学习模型。材料属性预测任务最高提升60%。 **完全开源可扩展**:基于LLaMA构建,代码托管在GitHub(https://github.com/masterai-eam/darwin),社区可自由贡献和扩展,未来能灵活添加新的知识模块,减少对闭源AI的依赖。

适用场景