06Ecosystem Projects · 生态项目

GenePad 生态项目

围绕分子克隆工具链,GenePad 组织在 GitHub 上维护若干独立项目:从可溯源的质粒通用元件库,到组织特异性密码子统计管线。各项目与主程序相互独立,可单独取用,旨在为科研工作者与开发者减少重复性工作。

01质粒通用元件库

266 ELEMENTS · 20 CATEGORIES · GENBANK + FASTA

质粒构建通用元件序列库

genepad-commonfeaturesMIT

从 NCBI 源参考质粒中逐条整理与核对的可复用元件序列库。每条元件均记录 NCBI 登录号与参考质粒名,序列来源可逐条回溯。导入质粒软件后,打开图谱即可自动识别这些常见元件。

数据规格

规模
266 个元件 · 20 个分类
溯源
每条元件记录 NCBI 登录号 + 参考质粒名
格式
GenBank (.gb) + FASTA (.fa) 双格式
兼容
SnapGene / Benchling common features 库导入即用
重建
fetch_features.py · export.py · verify.py 质量门
许可
MIT(元件序列为公共领域事实数据)

20 个覆盖分类

  • 抗生素抗性14
  • 复制起点12
  • 原核启动子16
  • 原核终止子6
  • 原核调控15
  • 哺乳动物启动子19
  • 哺乳动物 polyA4
  • 哺乳动物调控10
  • 酵母元件17
  • 植物元件8
  • 昆虫元件4
  • iGEM BioBrick 标准件30
  • AAV 载体元件15
  • 病毒载体元件9
  • 蛋白标签34
  • 荧光蛋白14
  • 报告酶7
  • 重组位点16
  • 引物结合位点12
  • 其他4

将 genbank/ 下的 .gb 导入 SnapGene 或 Benchling 的 common features 库,打开任意质粒图即可自动识别这些元件;fasta/ 下的 .fa 可直接用于 BLAST 比对。

02组织特异性密码子图谱

GTEX V8 · GENCODE 50 · EXPRESSION-WEIGHTED

人类组织特异性密码子图谱

GenePadCodonAtlasSOURCE-AVAILABLE · PROPRIETARY

独立实现的统计管线:以公开的 GTEx 基因表达与 GENCODE 注释为上游,按组织表达量加权,为人体每个组织重建密码子使用表,为密码子优化与异源表达设计提供可复现、可审查的组织特异性参考,避免依赖授权受限的第三方成品表。

数据规格

上游
GTEx v8 基因中位 TPM + GENCODE release 50(注释 + CDS FASTA)
方法
按组织表达加权计数;每基因取一条代表性编码转录本
输出
Frequency/1000 · 同义分数 · RSCU · CAI 权重 · 偏好密码子
工程
Python 管线 · unittest · 发布检查与打包脚本
商用
附商用自查清单(COMMERCIAL_USE_CHECKLIST)
许可
源码公开 · GenePad 专有许可(商用需书面授权)

输出指标

  • FREQUENCY / 1000
  • RSCU
  • CAI WEIGHTS
  • SYNONYMOUS FRACTION
  • PREFERRED CODONS
  • PER-TISSUE TABLES

python scripts/build_atlas.py 按 GTEx / GENCODE 输入重建全部组织表;check_release.py 与 package_release.py 负责发布前校验与打包。

上述项目由 GenePad 主项目孵化,并按同一标准维护。源码与进展请访问 GitHub 组织主页,欢迎提交 Issue 反馈。

GITHUB.COM/GENEPAD →