大模型数据集哪里可以获取呢?

发布时间:
2024-09-12 15:52
阅读量:
9

景联文科技作为大模型数据服务商,提供海量高质量大模型数据集。

世界知识类期刊及高价值社区文本数据:

  • 高质量外文文献期刊 8500万篇
  • 英文高质量电子书 200万本

教育题库:

  • K12教育题库 1800万
  • 大学题库 1.1亿,800万带解析
  • 英文题库 500万

专业知识类期刊、专利、代码:

  • 中文数字专利 4000万
  • 程序代码(代码注释) 20万

专利数据:

  • 全球专利基础著录数据 1.3亿
  • 全球专利原文数据 1亿
  • 全球专利附图数据
  • 全球专利法律状态数据
  • 全球专利法律状态数据
  • 全球专利引文数据
  • 全球专利分类索引数据
  • 全球专利重点申请人工商关联数据
  • 全球生化医药专利深加工数据
  • 全球专利全文数据

多轮对话:

  • 文本多轮对话 1500万
  • 中英文剧本(电影、电视剧、剧本杀) 6万

音频数据:

  • 普通话 65万小时

图片生成及隐式/显示推理多模态数据:

  • 图文复杂描述 600万
  • 图文推理问答对 600万

材料数据:

  • 金属材料数据 20万
  • 纳米材料数据 30万
  • 相图数据 6万
  • 材料性能数据 20万
  • 材料腐蚀数据
  • 表面处理数据
  • 焊接材料数据

同时景联文科技提供大模型训练数据的标注服务,致力于为全球数千家人工智能从业公司和高校科研机构交付海量、高质量的多模态大模型训练数据。

有兴趣可以看看我们官网~jinglianwen.com/ai/

景联文科技|数据采集|数据标注|大模型训练数据

助力人工智能技术,赋能传统产业智能转型升级

END