合合信息发布大模型加速器,破解国内大模型产业“语料荒”难题
创始人
2024-09-19 23:01:03

近日,合合信息在WAIC 2024上发布了用于大模型语料训练的“加速器”产品——TextIn智能文档处理平台。合合信息的思路是,从“炼丹”源头的燃料出发,通过标准化平台进行语料结构化,提高数据预训练效率,帮助大模型厂商达成有效的模型性能提升和迭代。

国内的大模型产业处于高速发展时期,面向各个细分领域的大模型如雨后春笋办涌现,例如处理文档的kimi、豆包,用于制作ppt的天工、万知,但做到与chatgpt媲美确非常困难。业内人士对这个现象的解释是,高质量的中文数据集实在紧缺,训模型时只能直接购买外文标注数据集或者直接采集开源的国外语料库作为外援。一旦“进口语料”加入的训练参数量多了,就会出现跟ChatGPT相似的回答方式。

国内外大模型数据集主要为英文,均源于许多开源数据集进行训练,如Common Crawl、RedPajama、BooksCorpus、The Pile、ROOT等。这部分数据虽然量多,但质量上却良莠不齐。一大优质的中文语料数据,沉睡在报告、论文、报纸等文档里。

为缓解语料荒困境,合合信息推出了用于大模型语料训练的“加速器”产品——TextIn智能文档处理平台。在训练前期阶段,使用“加速器”文档解析引擎,破解书籍、论文、研报等文档中的版面解析障碍,为模型训练与应用输送纯净的“燃料”;同时,“加速器”搭载了文本向量化模型,以解决大模型“已读乱回”的幻觉问题。

合合信息此次发布的大模型“加速器TextIn智能文档处理平台,由TextIn文档解析、TextIn Embedding(文本向量数据模型)以及OpenKIE三大工具组成。从获得海量数据到高价值数据,预训练阶段的语料处理十分关键。这意味着,作为一个平台型产品,向大模型厂商和开发者“递铲子”,其基础的工具能力是否足够扎实,关系到种子用户的购买意愿。

基于这一思路,合合信息在产品设计阶段提前做了几件事。首先是场景前置,在未个性化阶段提前给模型补充大量优质的垂直领域Know-how,比如金融、法律、教育等,关注特定行业中的普遍痛点,基于用户诉求在产品设计时提供解决方案,进而提高大模型加速器在核心应用场景中表现能力。二是专注产品化,不只对客户提供通用场景的API,而是提供更多工具型产品,降低应用门槛,做到开箱即用,这对技术资源较为薄弱的传统企业、中小创业公司或个人开发者来说非常友好。

大模型变革的浪潮里,以数据为中心,成为行业人士从事大模型研发和应用的共识。具体到实践层面,大模型上游阶段在文本解析、逻辑版面、文档问答等方面,仍有很多的提升工作可以做。

未来,合合信息将继续依托技术优势,面向人工智能产业的不足提出解决办法,助力大模型产业持续健康发展。

⚠️
本网站信息内容及素材来源于网络采集或用户发布,如涉及侵权,请及时联系我们,发送链接至2697952338@QQ.COM,我们将第一时间进行核实与删除处理。

相关内容

热门资讯

同 花 顺退款要多久? 交费被... 同 花 顺退款要多久? 交费被骗后悔不已,维权全额退款!  投资有风险,投资需谨慎!针对网上素未谋面...
外汇局:9月末我国银行业对外净... 12月30日,国家外汇管理局公布2025年9月末中国银行业对外金融资产负债数据,2025年9月末,我...
聚焦禹唐体育营销大会|众辉体育... 在主题为“IP经营:消费热潮下的体育IP经营之道”的圆桌论坛中,众辉体育董事长陆浩和盛力世家首席执行...
网友票选2025年度五大理财关... 2025年,存款利率步入“0字头”,金价屡创新高,大众理财意识正经历深刻转变。近日,蚂蚁财富与小红书...
博 众投资29800元服务费怎... 博 众投资29800元服务费怎么样? 误导性宣传坑惨股友,可维权退款!  投资有风险,投资需谨慎!针...
利多星选股可靠吗您的投顾服务费... 利多星选股可靠吗您的投顾服务费或可退回!深度揭秘销售陷阱与投诉通道利多星智投不可信,推荐的股票不靠谱...
“补血”超千亿元!保险业为何仍... 编者按:近年来,保险行业资本动作频繁,股权转让、资产处置(出售/收购)、二级市场股权交易、发债融资等...
天相股多多软件是正规的吗能退!... 北京天相财富收取股民服务费没效果会员费能退回来?北京天相财富并不靠谱,在北京天相财富业务员的诱导下购...
四川大 决 策证券靠谱吗? 夸... 四川大 决 策证券靠谱吗? 夸大收益坑股民交费,维权可追回!  投资有风险,投资需谨慎!针对网上素未...
2026,保持悲观的乐观主义 文 | 逻辑学家,作者 | 汪德嘉 人工智能时代是人类历史上变革最剧烈的技术时代。2025年从De...