a2zchromatin-accessibility:革命性植物染色质状态预测工具,600bp DNA序列即可精准分析

a2zchromatin-accessibility:革命性植物染色质状态预测工具,600bp DNA序列即可精准分析

【免费下载链接】a2zchromatin-accessibility项目地址: https://ai.gitcode.com/hf_mirrors/multimolecule/a2zchromatin-accessibility

a2zchromatin-accessibility是一款基于深度学习的革命性植物染色质状态预测工具,仅需600bp DNA序列即可精准分析染色质可及性或DNA甲基化状态。作为multimolecule项目的重要组成部分,该工具采用CNN+BLSTM的DanQ拓扑结构,为植物生物学研究提供了高效、准确的序列分析解决方案。

🌟 核心功能与技术优势

🔬 精准预测,仅需600bp序列

a2zchromatin-accessibility采用固定长度600bp的DNA序列作为输入,通过深度学习模型预测染色质状态。这种设计既保证了预测精度,又降低了对输入数据长度的要求,使研究人员能够更灵活地开展实验设计。

🧠 先进的深度学习架构

该工具的核心是一个递归卷积神经网络,融合了卷积神经网络(CNN)和双向长短期记忆网络(BLSTM)的优势:

  • 单个卷积层应用320个滤波器, kernel大小为26
  • 卷积后进行dropout(0.2)和13个位置的max-pooling
  • 特征序列输入到双向LSTM(每方向320个单元)
  • 最终前向和后向隐藏状态连接,通过925单元的密集层输出

🌱 跨物种适用性

模型训练数据涵盖了12种被子植物的叶片ATAC-seq峰值和10种被子植物的未甲基化区域(UMR)数据,使其具备广泛的跨物种预测能力,为植物基因组研究提供了强大工具。

🚀 快速开始

📦 安装指南

使用pip即可轻松安装multimolecule库,从而使用a2zchromatin-accessibility工具:

pip install multimolecule

🔍 基础使用方法

以下是使用a2zchromatin-accessibility进行染色质状态预测的简单示例:

import torch from multimolecule import DnaTokenizer, A2zChromatinForSequencePrediction tokenizer = DnaTokenizer.from_pretrained("multimolecule/a2zchromatin-accessibility") model = A2zChromatinForSequencePrediction.from_pretrained("multimolecule/a2zchromatin-accessibility") input = tokenizer("ACGT" * 150, return_tensors="pt") # 生成600bp的DNA序列 output = model(**input) print(output.logits.shape) # 输出形状: torch.Size([1, 1])

📋 接口说明

  • 输入长度:固定600bp DNA窗口
  • 字母表:DNA IUPAC tokens;模糊碱基使用上游A/C/G/T分数混合,非IUPAC标记映射为零
  • 输出:单个窗口logit(a2z-accessibility为染色质可及性,a2z-methylation为DNA甲基化缺失)

🧪 模型规格详情

卷积层数LSTM层数(双向)隐藏层大小参数数量(M)FLOPs(M)MACs(M)最大标记数
119251.2314.617.30600

📚 训练细节

🧬 训练数据

a2z-chromatin在两个跨物种数据资源上进行训练:

  • 染色质可及性:来自12种被子植物的叶片ATAC-seq峰值,每个600bp基因组区间标记为可及或不可及
  • DNA甲基化:来自10种被子植物的未甲基化区域(UMR)数据,每个600bp基因组区间标记为未甲基化或甲基化

🔧 训练过程

  • 优化器:Adam
  • 损失函数:二元交叉熵
  • 正则化:Dropout(卷积后0.2,双向LSTM后0.5)
  • 目标:最小化sigmoid激活的窗口预测与观察到的可及性/未甲基化标签之间的二元交叉熵损失

📝 引用与致谢

如果您在研究中使用了a2zchromatin-accessibility,请引用以下文献:

@article{wrightsman2022a2z, author = {Wrightsman, Travis and Marand, Alexandre P. and Crisp, Peter A. and Springer, Nathan M. and Buckler, Edward S.}, title = {Modeling chromatin state from sequence across angiosperms using recurrent convolutional neural networks}, journal = {The Plant Genome}, volume = 15, number = 3, pages = {e20249}, year = 2022, publisher = {Wiley}, doi = {10.1002/tpg2.20249} }

同时,也请考虑引用MultiMolecule项目:

@software{chen_2024_12638419, author = {Chen, Zhiyuan and Zhu, Sophia Y.}, title = {MultiMolecule}, doi = {10.5281/zenodo.12638419}, publisher = {Zenodo}, url = {https://doi.org/10.5281/zenodo.12638419}, year = 2024, month = may, day = 4 }

📄 许可证信息

本模型实现采用GNU Affero General Public License许可。有关其他条款和说明,请参阅我们的许可证常见问题。

SPDX-License-Identifier: AGPL-3.0-or-later

🔗 相关资源

  • 代码:multimolecule.a2zchromatin
  • 数据:来自12种被子植物的叶片ATAC-seq数据 + 10种被子植物的未甲基化区域数据
  • 论文:Modeling chromatin state from sequence across angiosperms using recurrent convolutional neural networks
  • 原始仓库:twrightsman/a2z-regulatory

🤝 联系与支持

有关模型卡片的任何问题或意见,请使用MultiMolecule的GitHub issues。

有关论文/模型的问题或意见,请联系a2z-chromatin论文的作者。

📥 获取项目

要获取完整项目代码,请克隆仓库:

git clone https://gitcode.com/hf_mirrors/multimolecule/a2zchromatin-accessibility

a2zchromatin-accessibility工具正不断优化和更新,为植物基因组学研究提供更强大的支持。无论您是植物生物学研究人员,还是对基因组分析感兴趣的新手,这款工具都能帮助您更深入地理解DNA序列与染色质状态之间的关系。

【免费下载链接】a2zchromatin-accessibility项目地址: https://ai.gitcode.com/hf_mirrors/multimolecule/a2zchromatin-accessibility

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考