BT

如何利用碎片时间提升技术认知与能力? 点击获取答案

浅析Microsoft DNA存储

| 作者 Sergio De Simone 关注 17 他的粉丝 ,译者 大愚若智 关注 9 他的粉丝 发布于 2016年5月5日. 估计阅读时间: 3 分钟 | CNUTCon 了解国内外一线大厂50+智能运维最新实践案例。

Microsoft正在实验用人工合成DNA实现数字化数据存储,并于最近向遗传学初创公司Twist Bioscience购买了一千万条DNA。

据悉Microsoft有关DNA存储的实验是与华盛顿大学(University of Washington)合作进行的。联合研究团队最近提交了一份描述下图所示完整DNA归档存储系统架构述的论文

DNA存储系统由一个对数据进行编码,以便将数据存储在DNA中的DNA合成器;一个包含大量“隔间”,将DNA的存储池与数据卷进行映射的存储容器;以及负责读取DNA序列并将其重新转换为原始数据的DNA序列器组成。

DNA存储技术目前有个非常有趣的问题需要解决:寻址。DNA链是DNA存储的基本单位,DNA链由大约100-200个核苷酸组成,可存储50–100比特信息。这意味着一个典型的数据对象需要映射至大量DNA链。研究人员目前使用了键-值架构,因此这里的关键在于首先需要关联至包含所需链的池,随后通过随机访问机制访问池中的链。

另一个有趣之处在于数据的呈现方式。DNA由4个碱基(A、C、G、T)组成,因此base-4是最直接的数据呈现方法,例如01110001可通过base-4的方式转换为1301,并映射为DNA序列中的CTAC结构。然而除此之外,研究人员还选择了一种base–3呈现方式,借此可通过一个核苷酸实现纠错。那么在上述的例子中,01100001可转换为base-3格式的01112,并映射至为DNA序列中的CTCTG结构。

有关DNA存储原理的详细信息,包括如何通过编码改善可靠性,以及目前进行过的几个实验,可参阅上文提及的PDF论文。

根据Twist Bioscience公司介绍,相对传统数字化存储,基于DNA的归档技术可提供两个重要优势:寿命更长,最新研究数据显示DNA数据存储的寿命高达2000年;并且数据密度更高,一克DNA即可存储一兆GB数据。

根据Microsoft和华盛顿大学研究人员的介绍,DNA存储并不是闪存或硬盘的替代品:

我们将DNA存储视作一种最持久的深层存储体系,可提供高密度且持久的归档存储方案,以及数小时乃至数天的访问时间。

这种想法的重点在于,DNA的合成和排序可以任意程度的序列化方式进行,因此可以轻松获得所需的读写带宽。

Microsoft公司DNA存储项目主管Doug Carmean澄清说,他们使用Twist提供的DNA进行初步测试“证明了数字化数据可通过这种方式进行编码,并可100%还原为原始数据”,但在这种技术正式商用之前还有很多工作有待完成。

作者:Sergio De Simone
阅读英文原文A Look at Microsoft DNA Storage


感谢张龙对本文的审校。

给InfoQ中文站投稿或者参与内容翻译工作,请邮件至editors@cn.infoq.com。也欢迎大家通过新浪微博(@InfoQ@丁晓昀),微信(微信号:InfoQChina)关注我们。

评价本文

专业度
风格

您好,朋友!

您需要 注册一个InfoQ账号 或者 才能进行评论。在您完成注册后还需要进行一些设置。

获得来自InfoQ的更多体验。

告诉我们您的想法

允许的HTML标签: a,b,br,blockquote,i,li,pre,u,ul,p

当有人回复此评论时请E-mail通知我

DNA的存储寿命更长? by 孙 庚泽

这个有意思啊,我还以为DNA需要精心呵护才能存活呢。。

允许的HTML标签: a,b,br,blockquote,i,li,pre,u,ul,p

当有人回复此评论时请E-mail通知我

允许的HTML标签: a,b,br,blockquote,i,li,pre,u,ul,p

当有人回复此评论时请E-mail通知我

1 讨论

登陆InfoQ,与你最关心的话题互动。


找回密码....

Follow

关注你最喜爱的话题和作者

快速浏览网站内你所感兴趣话题的精选内容。

Like

内容自由定制

选择想要阅读的主题和喜爱的作者定制自己的新闻源。

Notifications

获取更新

设置通知机制以获取内容更新对您而言是否重要

BT