小编mac*_*age的帖子

如何使用Biopython翻译FASTA文件中的一系列DNA序列并将Protein序列提取到一个单独的字段中?

我是 Biopython 的新手(以及一般编码),我正在尝试编写一种方法,将一系列 DNA 序列(超过 80 个)翻译成蛋白质序列,在一个单独的 FASTA 文件中。我还想在正确的阅读框中找到序列。

这是我到目前为止所拥有的:

from Bio import SeqIO
from Bio.SeqRecord import SeqRecord

for record in SeqIO.parse("dnaseq.fasta", "fasta"):
    protein_id = record.id
    protein1 = record.seq.translate(to_stop=True)
    protein2 = record.seq[1:].translate(to_stop=True)
    protein3 = record.seq[2:].translate(to_stop=True)

if len(protein1) > len(protein2) and len(protein1) > len(protein3):
    protein = protein1
elif len(protein2) > len(protein1) and len(protein2) > len(protein3):
    protein = protein2
else:
    protein = protein3

def prot_record(record):
    return SeqRecord(seq = protein, \
             id = ">" + protein_id, \
             description = "translated sequence")

records = …
Run Code Online (Sandbox Code Playgroud)

python parsing bioinformatics fasta biopython

2
推荐指数
1
解决办法
3071
查看次数

标签 统计

bioinformatics ×1

biopython ×1

fasta ×1

parsing ×1

python ×1