Investigating Temporal Motion Features for Pose-to-Text Indian Sign Language Translation
研究通过轻量级姿态编码器和预训练T5模型,结合显式运动特征,提升印度手语到文本翻译的准确性,其中T5-small+Motion表现最佳。
0 citationsRead paper
研究通过轻量级姿态编码器和预训练T5模型,结合显式运动特征,提升印度手语到文本翻译的准确性,其中T5-small+Motion表现最佳。
本文提出CEM-TUDASR,一种基于Transformer的无监督超分辨率方法,通过域自适应降质网络和注意力机制解决无线胶囊内镜图像分辨率低的问题。
研究针对社交媒体中的三语代码混用现象,通过序列标注问题和微调基于上下文的转换模型来准确识别代码混用文本中的语言。
本文提出MultiAttenGastro框架,通过多维度注意力机制提高胃肠道内镜分类模型在不同数据集上的泛化能力,尤其在与ImageNet特征差异大的情况下效果显著。
本文提出了一种新的基于低秩适应的空间注意力图神经网络(SA-GNN)方法,用于利用移动传感器数据预测城市中PM2.5浓度的时空变化,表现优于传统模型。
研究通过轻量级姿态编码器和预训练T5模型,结合显式运动特征,提升印度手语到文本翻译的准确性,其中T5-small+Motion表现最佳。
本文提出CEM-TUDASR,一种基于Transformer的无监督超分辨率方法,通过域自适应降质网络和注意力机制解决无线胶囊内镜图像分辨率低的问题。
研究针对社交媒体中的三语代码混用现象,通过序列标注问题和微调基于上下文的转换模型来准确识别代码混用文本中的语言。
本文提出MultiAttenGastro框架,通过多维度注意力机制提高胃肠道内镜分类模型在不同数据集上的泛化能力,尤其在与ImageNet特征差异大的情况下效果显著。
本文提出了一种新的基于低秩适应的空间注意力图神经网络(SA-GNN)方法,用于利用移动传感器数据预测城市中PM2.5浓度的时空变化,表现优于传统模型。