当前位置: 首页 » 快讯 » 快讯 » 正文

中国大模型语料数据联盟开源发布高质量多模态语料“书生·万卷”

作者：财中快讯 99708/14

据中证报，继今年7月在2023世界人工智能大会发起成立“中国大模型语料数据联盟”，上海人工智能实验室(上海AI实验室)于8月14日宣布，联合语料数据联盟成员单位，共同开源发布“书生.万卷”1.0多模态预训练语料。“书生.万卷”1.0目前包含

标签：

据中证报，继今年7月在2023世界人工智能大会发起成立“中国大模型语料数据联盟”，上海人工智能实验室(上海AI实验室)于8月14日宣布，联合语料数据联盟成员单位，共同开源发布“书生.万卷”1.0多模态预训练语料。“书生.万卷”1.0目前包含文本数据集、图文数据集、视频数据集三部分，本次开源的数据总量超过2TB。该语料数据包含超过5亿个文本，2200万个图文交错文档，1000个节目影像视频，具备多元融合、精细处理、价值对齐、易用高效等四大特征。

免责声明：本网转载合作媒体、机构或其他网站的公开信息，并不意味着赞同其观点或证实其内容的真实性，信息仅供参考，不作为交易和服务的根据。转载文章版权归原作者所有，如有侵权或其它问题请及时告之，本网将及时修改或删除。凡以任何方式登录本网站或直接、间接使用本网站资料者，视为自愿接受本网站声明的约束。联系电话 010-57193596，谢谢。

首页

资讯

财中号

品牌

专题

投资学院

发布文章

APP下载

热点

国资

产业

券商

基金

金融

上市公司

财富

专题

中国大模型语料数据联盟开源发布高质量多模态语料“书生·万卷”

国家卫健委：春节期间全国疫情防控工作平稳有序整体疫情已进入低流行水平

首页

资讯

财中号

品牌

专题

投资学院

发布文章

APP下载

中国大模型语料数据联盟开源发布高质量多模态语料“书生·万卷”

您可能感兴趣的文章