To Each Language Its Tokenizer: Modular Tokenizers for Efficient Multilingual LLMs
本文针对多语言大模型的词汇压缩不均和资源浪费问题,提出模块化分词器学习方法及预训练策略,提高效率与跨语言公平性。
0 citationsRead paper
本文针对多语言大模型的词汇压缩不均和资源浪费问题,提出模块化分词器学习方法及预训练策略,提高效率与跨语言公平性。
本文研究了欧几里得空间中设施选址问题,旨在设计一种机制最小化设施与最远代理间的期望距离,并确保代理无动机谎报位置。
本文提出RCBNB-MB算法,通过识别时间序列中的潜在因果机制来解决非平稳时间序列的因果结构发现问题,利用马尔可夫毯提高鲁棒性。
本文提出了一种名为HOOD的学习算法,通过结合高阶预测器和熵正则化方法,在一般博弈中实现了O(N^3 log^2 K)的个体遗憾上界。
本文提出AdaRDiff方法,通过自适应加权差分简化时间序列,解决长期预测中趋势和季节性带来的复杂结构问题。
本文针对多语言大模型的词汇压缩不均和资源浪费问题,提出模块化分词器学习方法及预训练策略,提高效率与跨语言公平性。
本文研究了欧几里得空间中设施选址问题,旨在设计一种机制最小化设施与最远代理间的期望距离,并确保代理无动机谎报位置。
本文提出RCBNB-MB算法,通过识别时间序列中的潜在因果机制来解决非平稳时间序列的因果结构发现问题,利用马尔可夫毯提高鲁棒性。
本文提出了一种名为HOOD的学习算法,通过结合高阶预测器和熵正则化方法,在一般博弈中实现了O(N^3 log^2 K)的个体遗憾上界。
本文提出AdaRDiff方法,通过自适应加权差分简化时间序列,解决长期预测中趋势和季节性带来的复杂结构问题。