范文健康探索娱乐情感热点
投稿投诉
热点动态
科技财经
情感日志
励志美文
娱乐时尚
游戏搞笑
探索旅游
历史星座
健康养生
美丽育儿
范文作文
教案论文

部署国产ChatGPT,首个功能型对话开源中文大模型ChatYuan开放下载

  编辑:LRS 好困
  【新智元导读】自己部署一个ChatYuan,再也不用担心网络拥堵了!
  前段时间,元语智能开发团队训练了一个类似ChatGPT的功能型对话大模型ChatYuan ,并在网页版中开放了试玩接口。
  现在你也可以在自己的机器上部署一个ChatYuan了!
  模型可用于问答场景,能够结合上下文做对话、做各种生成任务,包括创意性写作,也能回答法律、新冠等领域类问题。
  并且在全中文任务中支持零样本学习,用户可以通过提供prompt的方式来使用,支持文本生成、信息抽取和理解大类下近30多种中文任务。
  ChatYuan基于PromptCLUE-large结合数亿条功能问答和多轮对话数据进一步训练得到,模型参数量7.7亿,显存6G左右,一张民用显卡即可加载使用,目前模型已开放下载。
  PromptCLUE在1000亿token中文语料上预训练,累计学习1.5万亿中文token,并且在数百种任务上进行Prompt任务式训练。
  针对理解类任务,如分类、情感分析、抽取等,可以自定义标签体系;针对多种生成任务,可以进行采样自由生成。
  如何使用
  1. Github
  项目地址:https://github.com/clue-ai/ChatYuan
  2. Huggingface
  项目地址:https://huggingface.co/ClueAI/ChatYuan-large-v1
  3. ModelScope
  项目地址:https://modelscope.cn/models/ClueAI/ChatYuan-large
  加载模型:
  使用模型进行预测推理方法:
  4. PaddlePaddle
  项目地址:https://aistudio.baidu.com/aistudio/projectdetail/5404182
  模型地址:https://huggingface.co/ClueAI/ChatYuan-large-v1-paddle
  使用自有数据训练模型
  1. 组织数据
  将数据组织成统一的格式,由两部分构成:输入(Input)和输出(Output)。
  针对单轮问答或生成:
  输入(Input):任务描述+输入文本
  输出(Output):系统需要预测的文本,如下图中「小元」后的内容。
  针对多轮对话:
  输入(Input):任务描述+上文+输入文本
  输出(Output):系统需要预测的文本,如下图中「小元」后的内容。
  单轮对话数据格式:
  多轮对话数据格式:
  2. 训练模型
  训练代码可以参考:
  使用pCLUE数据集进行训练、预测和效果验证, pytorch实现——在线colab。
  Github项目:https://colab.research.google.com/drive/1lEyFhEfoc-5Z5xqpEKkZt_iMaojH1MP_?usp=sharing
  举个例子
  ==========示例1==========
  用户:
  你能干什么
  小元:
  您好!我是元语AI。我可以回答您的问题、写文章、写作业、翻译,对于一些法律等领域的问题我也可以给你提供信息。
  ==========示例2==========
  用户:
  写一个诗歌,关于冬天
  小元:
  冬夜寂静冷,
  云在天边飘,
  冰封白雪上,
  寒冷像一场雪。
  雪花融化成冰,
  像那雪花飘洒,
  在寒冷的冬天,
  感受春天的喜悦。
  冬日里,
  风雪渐消,
  一片寂静,
  把快乐和温暖带回家。
  ==========示例3==========
  用户:
  学前教育专业岗位实习中,在学生方面会存在问题,请提出改进措施。800字
  小元:
  在学前教育专业岗位实习中,在学生方面会存在一些问题,如学生缺少专业知识、缺乏合作意识、缺乏基本的责任心等等,需要我们采取措施,来解决这些问题。
  首先,在实习过程中,我们需要培养学生的团队意识,加强学生与老师之间的合作,加强与家长之间的沟通,提高他们的沟通能力。另外,我们也需要加强学生的独立性,让学生学会独立思考,学会和老师、家长进行沟通,培养其独立性。
  此外,在日常的工作中,我们也要为学生提供适当的机会和机会,让学生多接触社会、多参加社会活动,加深他们对社会、学校的认识,培养他们主动、积极和创新的精神。
  最后,我们还需要重视学生在实习中出现的问题,尤其是学生缺乏合作,有依赖心理,不懂得分享,有拖延行为等,这些学生应该引起我们的重视,制定合理的改进措施,改善这些问题。 技术与训练过程
  ChatYuan是在PromptCLUE基础上进一步训练获得的模型。它去掉了文本理解、信息抽取类任务,加强了问答、对话和各种生成式任务的学习和训练;
  针对多轮对话容易受到上下文的干扰,加入了抗干扰数据使得模型可以在必要时忽略无关的上下文;加入了用户反馈数据的学习,使得模型不仅具有一定的通用语言理解能力、特定任务上的生成能力,也能更好的响应用户的意图。
  PromptCLUE的学习过程
  三大统一:统一模型框架(text-to-text),统一任务形式(prompt),统一应用方式(zero-shot/few-shot)(T0)
  大规模预训练:在t5-large版基础上,使用数百G中文语料,训练了100万步,累积训练了1.5万亿个中文字词级别token
  大规模任务数据:使用了16种任务类型,数百种任务,累积亿级别任务数据
  混合预训练:一方面将下游任务作为预训练语料,另一方面将下游任务和预训练语料一起训练,减少任务灾难遗忘以及缩短预训练和下游任务的距离,更好的适应下游任务(ExT5)
  混合采样:针对众多数据量差异极大的任务,采用在每个训练batch内对所有的任务进行按照比例采样,根据任务的数据量进行平滑采样,并且同时限制任务数据量采样池的上限。平滑采样可以减少任务训练有偏危害,在每一batch内训练可以减少异质任务之间训练负迁移的情况(T5)
  分阶段训练:一方面指在预训练分阶段,涉及训练序列长度的分阶段(128和512),加快预训练速度(Bert);另一方面,在下游训练分阶段, 涉及学习率和序列长度的变化以及递减式对下游任务的数据量限制,更好的适应下游的不同任务。
  增加语言模型的训练:参考t5.1.1, 除了使用Span Corrpution构建的方式进行无监督训练,同时在使用prefix LM的方式训练,增强生成任务的能力(LM adapted)
  增加对模型的encoder以及decoder的训练:根据下游任务数据分别构建Data_text,Data_target预训练数据语料,加入到预训练中,分别增强模型的encoder理解能力和 decoder的生成能力(见UIE)
  重新构建模型中文字典:使用sentencepiece上在千亿token上学习并构建模型字典,更加符合中文语言习惯
  后续工作
  目前版本可以进行问答、对话和各种创意性写作或文本生成,相对于线上的版本,它的意图理解和生成能力在一些场合还有比较大的提升空间;它也还不能较好实现推理或复杂的任务。之后,会根据反馈进一步改进现有版本。

又一宠妻人设崩塌?孙怡董子健突然离婚,两人8000万财产曝光作者阿何有话说来源阿何有话说(IDaheshiwo)昨天,孙怡董子健官宣离婚。孙怡发文从前祝我们,今后祝你我,董子健也发文咱都好好的。五年婚姻,分道扬镳,着实有些唏嘘。他们育有一个坚决抵制一切形式的代孕重利之下,你我都是猎物昨天,郑爽前男友张恒的一则微博,引发了社会的广泛关注。并将代孕这个话题,带进了公众的视野里。张恒在微博中提到,在美国滞留是为了照顾并保护两个年幼无辜的小生命。随即,就爆出了两份出生58岁玉兔精李玲玉落魄卖唱,坎坷情史唏嘘曝光还记得之前有一个话题记住我们心目中的妖精,一度占据热门话题榜榜首。玉兔精的扮演者李对观众的影响最为深刻。然而,在拍摄完西游记后,因为某些原因,李玲玉很少参演电视剧。而是专注于唱歌。连环画寻子遇仙记。。。。。。反特连环画东海小哨兵上美版。。。。。。故事连环画一只脚。。。。。。西行三国智闯六道!少年三国志x少年西游记热血联动来袭西行三国,智闯六道!少年三国志和少年西游记热血联动,8月5日即将开启!三国和西游作为国民经典IP,热度经久不衰。基于这两个IP打造的卡牌手游少年三国志和少年西游记也经受住了时间的考到底该买哪款手机?收下这篇手机型号指南,挑选不再忧愁你的手机是不是用了一阵子就会变卡?可能是买手机的时候没有注意到这些手机型号的字母。记住这些字母,买手机就再也不会踩坑啦!我们可以先去手机设置里找到关于手机,然后再跟小编一起往下看。精致女人,最令人欣赏的8个生活方式1站有站姿,坐有坐姿,很注意自己的举止和姿态。2不追求以瘦为美,会自律控制体重,为了健康并不是为了其他。3懂自我养护,不单单是脸,保持头发的光泽指甲的干净,身体的顺滑。4平时出门常高血压糖尿病高尿酸分别不能吃什么?收好这份实用清单每当生病的时候就会从爸妈亲戚朋友等各种渠道被告知需要忌口这个不能吃!那个不能喝!虽然有些做法并不科学但其实忌口是为了让病好得更快我们应该了解常见病的禁忌如果生不同病时不注意相应的饮农村常见的狗尾巴草,其实大有来头,拿来泡水喝能收获3个好处对于生长在农村的小伙伴来说,狗尾巴草一点也不陌生,几乎随处可见。儿时总用狗尾巴草编各种各样的东西,逗小伙伴等。虽然狗尾巴草并不起眼,但在中医眼中是一味好药材,只要正确使用狗尾巴草,
防守大闸!1617赛季起戈贝尔总盖帽ampampamp防守胜利贡献值联盟第一直播吧7月2日讯据名记Woj此前报道,森林狼送出比斯利贝弗利凯斯勒(今年的首轮22顺位)范德比尔特莱安德罗博尔马罗和四个首轮签,从爵士得到戈贝尔。知名数据媒体BasketballR对手失误频频,中国女排3比0轻取多米尼加文羊城晚报全媒体记者苏荇世界女排联赛保加利亚索菲亚站,中国女排1日晚以3比0(25比1925比16和25比15)完胜多米尼加队,以11战7胜4负积23分的成绩暂列世联赛积分榜第四位女儿像爸爸福气好,有这3种特征的爸爸,才是女儿真正的福气从女儿出生开始,身边的亲朋好友每次见到女儿都会说长得好像她爸爸呀,女儿像爸爸福气好!作为父母,我们都希望孩子把优点全继承了,缺点全没有。然而,这只是一种理想状态罢了,是我们自己的想暑日炎炎,避暑玩水好去处古诗有云山涧清且浅,可以濯吾足。酷热的高温天来了,但是在北京有一处大人可以乘凉爬山,野餐,孩子可以嬉戏玩水捞鱼的地方。这就是百泉山,这里全是溪水,顺着石路流下来,沿途皆可玩水,捞鱼霍华德请求加盟勇士只有库里才能激活我的能力,去年是我不懂事霍华德如今正闲赋在家,虽然自由市场已经开启各支球队都已经开始寻找自己的心仪对象,但是霍华德似乎备受冷落,现在还没有任何一支球队表达出来对他的兴趣,要知道在去年夏天的时候勇士曾猛烈追杜兰特寻求交易,钢铁直男的惨烈人生杜兰特寻求交易了,要去强队组建超级球队。且不说他与勇士的爱恨情仇,也不说快船的重磅交易,单说詹姆斯字母哥这些个大佬枭雄,也不会坐以待毙。不管去哪,不管跟谁组建航空母舰,这一路必定充杜兰特1换9地震级交易,篮网梦想成真获6个首轮,勇士卫冕遇劲敌今日,森林狼给爵士的戈贝尔开出10换1的豪华报价后,篮球圈都在议论,连戈贝尔都能换回4个首轮签,杜兰特到底能换什么筹码呢?篮网总经理马克斯此前的底线是一个未来新星3个首轮签,而如今杜锋为什么带这么多后卫,除了周琦,其他人不敢挺身而出中国队输给澳大利亚队很正常,中国男篮在巅峰时期都无法赢澳大利亚队,只要不是大比分输球就好,澳大利亚的三分打开了,杀伤力很大!几乎每场都有这个战术,就看下一场中国男篮怎么去克服了。杜官宣3笔新交易,9笔新签约!勇士绿军成最大赢家,最贵双塔诞生NBA联盟现在签约减少了许多,不过,新的交易也逐渐开始诞生,而且是大笔的交易。凯尔特人森林狼和爵士队都有大笔交易达成,绿军连续收获得力悍将,成为大赢家之一。卫冕冠军勇士队也是赢家之中澳男篮二番战,5大取胜之匙,重用小将朱俊龙,扩大防守阵型男篮世预赛正火热进行中,目前中国男篮取得一胜一负的战绩,第一场以7分之差惜败澳大利亚男篮,让对方投进了15记三分球,命中率接近50,失误多达18次,之所以能够咬住比分,与内线强势有让人念念不忘的古装男神,我只服这16位!个个玉树临风,风流倜傥近年来,影视圈中,古偶逐渐占据主流。可不知什么时候起,古偶竟然不看脸了?逢君正当时剧中的设定,男主是第一美男,刚开头各种正面侧面描写他帅的人神共愤。结果就这?你管这叫第一美男?(不