Dictionnaire de données

Le dictionnaire de données CQDG fournit des informations sur la structure et le contenu des données. Le format et les restrictions spécifiques pour chaque champ de données y sont définis. Les données des études participant au CQDG doivent être entièrement compatibles avec la dernière version du dictionnaire pour garantir un standard de qualité des données. Les vues suivantes décrivent les attributs et les valeurs permises pour tous les champs des fichiers cliniques tsv pour la Plateforme de données du CQDG.

Version 6.2
17 fichiers avec 160 champs
Niveau de données:
Tout
Attributs:
Tout

Sample Registration (sample_registration)

5 Champs
L'ensemble des champs requis pour inscrire vos échantillons dans le CQDG. Il est nécessaire de procéder à l'inscription de vos échantillons avant de soumettre des données cliniques et fichiers de données moléculaires.
Exemple de nom de fichier: sample_registration[-optional-extension].tsv
Champ et description
Niveau de données
Attributs
Type
Valeurs permises
Notes et scripts
study_id
Identifiant pour l'étude
ID
Required
TEXT
Values must meet the regular expression
Les caractères alphanumériques ainsi que les points et tirets sont supportés. Maximum de 64 caractères.
submitter_participant_id
Identifiant pour le participant soumis par l'étude.
ID
Required
TEXT
Values must meet the regular expression
Les caractères alphanumériques ainsi que les points, tirets et barres de soulignement sont supportés. Maximum de 250 caractères.
submitter_biospecimen_id
Identifiant pour le spécimen biologique soumis par l'étude.
ID
Required
TEXT
Values must meet the regular expression
Les caractères alphanumériques ainsi que les points, tirets et barres de soulignement sont supportés. Maximum de 250 caractères.
submitter_sample_id
Identifiant unique pour l'échantillon moléculaire soumis par l'étude
ID
Required
TEXT
Values must meet the regular expression
Les caractères alphanumériques ainsi que les points, tirets et barres de soulignement sont supportés. Maximum de 250 caractères.
sample_type
Type d'échantillon moléculaire utilisé pour l'analyse
Core
Required
TEXT

NCIT:C449

NCIT:C812

Les codes sont tirés du NCI Thesaurus (NCIt) http://purl.obolibrary.org/obo/ncit.owl . L'ontologie peut être consultée à https://www.ebi.ac.uk/ols4/ontologies/ncit DNA (NCIT:C449), Ribonucleic Acid (NCIT:C812)

Study (study)

30 Champs
Ensemble de champs reliés à l'étude contribuant des données au CQDG. Ce schéma est requis pour une soumission minimale.
Exemple de nom de fichier: study[-optional-extension].tsv
Champ et description
Niveau de données
Attributs
Type
Valeurs permises
Notes et scripts
study_id
Identifiant unique pour l'étude
ID
Required
TEXT
Values must meet the regular expression
Les caractères alphanumériques ainsi que les points et tirets sont supportés. Maximum de 64 caractères.
name
Nom de l'étude
Core
Required
TEXT
program_id
Identifiant du programme auquel l'étude appartient.
Core
TEXT

DESIIR

SK-CHUSJ

RARE-QC

MGSS

Fournir une liste délimitée par des points-virgules (;).
description
Brève description de l'étude
Core
Required
TEXT
Indiquer la description en français avant celle en anglais, séparées par le caractère pipe (|).
keyword
Mots-clés associés à l'étude
Extended
TEXT
Liste de mots-clés délimitée avec des points-virgules (;)
access_authority
Contact du responsable de l'accès
Extended
TEXT
Veuillez fournir le site Web ou courriel du responsable de l'accès. Ce champ est affiché sur le portail pour indiquer aux utilisateurs comment demander l'accès aux fichiers à accès contrôlé de cette étude.
domain
Domaine de recherche de l'étude
Core
Required
TEXT

Aging

Birth Defects

Cancer

Circulatory and Respiratory Health

General Health

9 more
population
Population cible de l'étude
Core
Required
TEXT

Adult

Fetal

Pediatric

Pediatric and Adult

access_limitations
Restrictions pour l'accès telles que définies dans l'ontologie DUO de GA4GH
Core
Required
TEXT

DUO:0000004

DUO:0000006

DUO:0000007

DUO:0000011

DUO:0000042

Référez-vous au Data Use Ontology https://github.com/EBISPOT/DUO. Parcourez les sous-classes de 'data use permission' à http://purl.obolibrary.org/obo/DUO_0000001. Un seul code doit être fourni.
access_requirements
Conditions d'utilisation telles que définies dans l'ontologie DUO de GA4GH
Core
Required
TEXT

DUO:0000012

DUO:0000015

DUO:0000016

DUO:0000018

DUO:0000019

13 more
Référez-vous aux codes du Data Use Ontology pour obtenir la définition des codes https://github.com/EBISPOT/DUO. Parcourez les sous-classes de 'data use modifier' à http://purl.obolibrary.org/obo/DUO_0000017. Fournir une liste délimitée par des points-virgules (;).
data_source
Décrit la principale source des données colligées des participants de l'étude
Core
Required
TEXT
selection_criteria
Critères d'inclusion et d'exclusion de l'étude
Core
Required
TEXT
publication
Digital Object Identifier de la publication décrivant la méthodologie et les critères de sélection de l'étude.
Extended
TEXT
Veuillez fournir un hyperlien DOI avec le format suivant, https://doi.org/ suivi du numéro DOI.
restricted
Est-ce une étude à accès restreint (aucune donnée au niveau des individus disponible)?
Core
Required
BOOLEAN
data_category
Catégories de données recueillies dans cette étude. (ex. génomique, imagerie, etc).
Core
Required
TEXT

genomics

imaging

clinical

transcriptomics

proteomics

2 more
Fournir une liste délimitée par des points-virgules (;).
design
Conception générale de l'étude, y compris si elle est longitudinale et si des membres de la famille ou autres contrôles non apparentés sont également inscrits.
Core
Required
TEXT

case_only

case_control

retrospective

registry

prospective

3 more
Fournir une liste délimitée par des points-virgules (;).
data_collection_method
Décrit les méthodes de collecte de données de l'étude.
Core
Required
TEXT

investigator_assessment

participant_caregiver_report

medical_records

Fournir une liste délimitée par des points-virgules (;).
expected_number_participants
Nombre attendu de participants dans une étude prospective.
Extended
INTEGER
Recommandé si le design de l'étude inclut 'prospective'. Indiquer le nombre total de participants attendus pour cette étude.
expected_number_biospecimens
Nombre attendu de biospécimens dans une étude prospective.
Extended
INTEGER
Recommandé si le design de l'étude inclut 'prospective'. Indiquer le nombre total de biospécimens attendus pour cette étude.
expected_number_files
Nombre attendu de fichiers dans une étude prospective.
Extended
INTEGER
Recommandé si le design de l'étude inclut 'prospective'. Indiquer le nombre total de fichiers attendus pour cette étude.
restricted_number_participants
Nombre de participants dans une étude à accès restreint.
Extended
Conditional
INTEGER
Requis pour une étude à accès restreint. Indiquer le nombre total de participants attendus pour cette étude à accès restreint.
restricted_number_biospecimens
Nombre de biospécimens dans une étude à accès restreint.
Extended
Conditional
INTEGER
Requis pour une étude à accès restreint. Indiquer le nombre total de biospécimens attendus pour cette étude à accès restreint.
restricted_number_files
Nombre de fichiers dans une étude à accès restreint.
Extended
Conditional
INTEGER
Requis pour une étude à accès restreint. Indiquer le nombre total de fichiers attendus pour cette étude à accès restreint.
principal_investigators
Noms des chercheurs principaux de cette étude.
Extended
Required
TEXT
Fournir une liste délimitée par des points-virgules (;).
contact_name
Noms de la ou des personnes contact pour les questions générales sur cette étude.
Core
Required
TEXT
Fournir une liste délimitée par des points-virgules (;).
contact_institution
Institutions affiliées de la ou des personnes contact pour les questions générales sur cette étude.
Core
Required
TEXT
Fournir une liste délimitée par des points-virgules (;).
contact_email
Adresses courriel de la ou des personnes contact pour les questions générales sur cette étude.
Core
Required
TEXT
Fournir une liste délimitée par des points-virgules (;).
website
Site web de l'étude.
Extended
TEXT
Une URL valide
funding_source
Sources de financement de l'étude.
Extended
TEXT
Fournir une liste délimitée par des points-virgules (;).
citation_statement
Déclaration de citation de données recommandée pour cette étude.
Extended
TEXT

Dataset (dataset)

3 Champs
Ensemble de champs reliés à un jeu de données spécifique appartenant à une étude du CQDG. Un jeu de données est un sous-ensemble de données provenant d'un seul type d'approche expérimentale. Si cette table est soumise, la table dataset_mapping doit également être soumise.
Exemple de nom de fichier: dataset[-optional-extension].tsv
Champ et description
Niveau de données
Attributs
Type
Valeurs permises
Notes et scripts
study_id
Identifiant unique pour l'étude
ID
Required
TEXT
Values must meet the regular expression
Les caractères alphanumériques ainsi que les points et tirets sont supportés. Maximum de 64 caractères.
dataset_name
Nom du jeu de données
ID
Required
TEXT
dataset_description
Description brève du jeu de données
Core
Required
TEXT
Veuillez décrire le but, l'approche expérimentale et les critères de sélection du jeu de données.

Participant (participant)

16 Champs
Ensemble de champs reliés aux caractéristiques des participants dans le CQDG. Ce schéma est requis pour une soumission minimale.
Exemple de nom de fichier: participant[-optional-extension].tsv
Champ et description
Niveau de données
Attributs
Type
Valeurs permises
Notes et scripts
study_id
Identifiant pour l'étude
ID
Required
TEXT
Values must meet the regular expression
Les caractères alphanumériques ainsi que les points et tirets sont supportés. Maximum de 64 caractères.
submitter_participant_id
Identifiant unique pour le participant soumis par l'étude
ID
Required
TEXT
Values must meet the regular expression
Les caractères alphanumériques ainsi que les points, tirets et barres de soulignement sont supportés. Maximum de 250 caractères.
age_at_recruitment
Âge (en jours) du participant au moment du recrutement
Core
INTEGER
sex_at_birth
Sexe biologique du participant
Core
Required
TEXT

Male

Female

Intersex

Another Sex

Missing - Unknown

3 more
Le sexe biologique à la naissance est distinct de l'identité de genre, qui est capturée dans un autre champ.
sex_another_category
Specifier la valeur de 'Another Sex' pour sex_at_birth
Core
Conditional
TEXT
Requis si la valeur de sex_at_birth est 'Another Sex'.
sex_collect_method
Indique comment les données sex_at_birth ont été collectées
Core
Required
TEXT

Self-identified

Clinician-recorded

Derived

Other

Missing - Unknown

3 more
gender
Identité de genre du participant
Core
Required
TEXT

Man

Woman

Another Gender

Prefer not to answer

Not applicable

4 more
Le genre fait référence aux rôles, comportements, expressions et identités socialement construits des filles, des femmes, des garçons, des hommes et des personnes de genre divers. Le genre d'une personne peut être le même ou différent de son sexe assigné à la naissance et peut changer au fil du temps.
gender_another_category
Specifie la valeur de 'Another Gender' pour gender
Core
Conditional
TEXT
Requis si la valeur de gender_another_category est 'Another Gender'.
gender_collect_method
Indique comment les données de genre ont été collectées
Core
Required
TEXT

Self-identified

Other

Missing - Unknown

Missing - Not collected

Missing - Not provided

1 more
race
Race du participant
Core
Required
TEXT

Black

East Asian

Indigenous (First Nations, Inuk/Inuit, Métis)

Latin American

Middle Eastern or North African

10 more
La race est une construction sociale utilisée pour juger et catégoriser les personnes selon des différences perçues dans l'apparence physique, de manière à créer et maintenir des rapports de pouvoir dans les hiérarchies sociales. La classification en groupes raciaux n'a aucun fondement biologique probant sur le plan scientifique [RÉF : Institut canadien d'information sur la santé. Directives sur l'utilisation des normes de collecte de données fondées sur la race et l'identité autochtone pour la production de rapports sur la santé au Canada (2022)]. Les participants peuvent avoir plusieurs identités raciales. Toutes les catégories sélectionnées par les participants doivent être rapportées.
race_another_racial_category
Une réponse qui ne correspond à aucune des catégories de déclaration raciale précédentes (par exemple, les identités insulaires du Pacifique, les identités autochtones en dehors de l'Amérique du Nord, etc.).
Core
Conditional
TEXT
Requis si la valeur de race_another_racial_category est 'Another Racial Category'
race_collect_method
Indique comment les données de race ont été collectées
Core
Required
TEXT

Socially assigned

Self-identified

Derived

Missing - Unknown

Missing - Not collected

2 more
Les réponses des projets prospectifs doivent toujours être auto-identifiées. Pour respecter l'autonomie des participants et leur droit à l'autodétermination, ainsi que pour éviter de confondre les différences dans la structure (génétique) de la population avec des catégories raciales socialement construites, les réponses qui ont été auto-identifiées ne doivent pas être agrégées avec des réponses qui ont été socialement assignées ou dérivées.
ethnicity_deprecated
OBSOLÈTE Identité éthnique du participant
Extended
TEXT

French Canadian

English Canadian

First Nation, Inuit, Metis

European

Arab

6 more
Ce champ est OBSOLÈTE. Il est maintenu dans cette version du dictionnaire pour faciliter la transition vers les nouvelles définitions d'ethnicité et de race. Les Canadiens français désignent les Canadiens dont les ancêtres font partie des colons français venus s'installer au Canada. Les Canadiens anglais désignent les Canadiens anglophones d'ascendance et de culture anglaise.
vital_status
Statut vital du participant
Core
Required
TEXT

Alive

Deceased

Missing - Not collected

Missing - Not provided

Missing - Restricted access

2 more
cause_of_death
Cause du décès
Core
Conditional
TEXT

Cancer

Heart disease

Cerebrovascular disease

Accidental death

Chronic lower respiratory diseases

5 more
Requis si le participant est décédé. La liste des valeurs acceptables comprend : 'Cancer', 'Heart disease', 'Cerebrovascular disease', 'Accidental death', 'Chronic lower respiratory diseases', 'Influenza and pneumonia', 'Natural', 'Suicide', 'Other reason', 'Unknown'.
age_of_death
Âge du participant (en jours) au moment de son décès
Core
Conditional
NUMBER
Requis si le participant est décédé. Fournir un nombre compris entre 0 et 40000 (inclus).

Biospecimen (biospecimen)

11 Champs
Ensemble de champs reliés au spécimen biologique du participant. Un spécimen biologique est tout type d'échantillon biologique collecté pour analyse, pour des fins de diagnostic ou pour la recherche. Pour soumettre plus d'un spécimen biologique pour un participant, veuillez ajouter des lignes dans la table biospecimen pour ce participant. Ce schéma est requis pour une soumission minimale.
Exemple de nom de fichier: biospecimen[-optional-extension].tsv
Champ et description
Niveau de données
Attributs
Type
Valeurs permises
Notes et scripts
study_id
Identifiant pour l'étude
ID
Required
TEXT
Values must meet the regular expression
Les caractères alphanumériques ainsi que les points et tirets sont supportés. Maximum de 64 caractères.
submitter_participant_id
Identifiant pour le participant soumis par l'étude
ID
Required
TEXT
Values must meet the regular expression
Les caractères alphanumériques ainsi que les points, tirets et barres de soulignement sont supportés. Maximum de 250 caractères.
submitter_biospecimen_id
Identifiant unique pour le spécimen biologique soumis par l'étude
ID
Required
TEXT
Values must meet the regular expression
Les caractères alphanumériques ainsi que les points, tirets et barres de soulignement sont supportés. Maximum de 250 caractères.
age_biospecimen_collection
Âge du participant (en jours) au moment de la collecte du spécimen biologique
Extended
NUMBER
biospecimen_tissue_source
Source tissulaire du spécimen biologique
Core
Required
TEXT
Values must meet the regular expression
Les codes sont tirés du NCI Thesaurus (NCIt) http://purl.obolibrary.org/obo/ncit.owl . L'ontologie peut être consultée à https://www.ebi.ac.uk/ols4/ontologies/ncit Ex: Blood (NCIT:C12434), Saliva (NCIT:C13275), Solid Tissue Sample (NCIT:C164014), Bone Marrow (NCIT:C12431), Umbilical Cord (NCIT:C34320), Umbilical Blood (NCIT:C34319). La valeur 'Missing - Unknown' est aussi permise.
tumor_normal_designation
Le spécimen biologique provient d'un tissu tumoral ou normal
Core
Required
TEXT

Normal

Tumor

Not applicable

Indiquez `Not applicable' si le spécimen biologique n'a pas été analysé.
cancer_biospecimen_type
Description du type de tissu d'où provient le spécimen biologique (spécifique au cancer), basé sur le NCI Thesaurus (NCIt)
Core
Conditional
TEXT

NCIT:C156445

NCIT:C156440

NCIT:C156441

NCIT:C164032

NCIT:C18009

2 more
Les codes sont tirés du NCI Thesaurus (NCIt) http://purl.obolibrary.org/obo/ncit.owl . L'ontologie peut être consultée à https://www.ebi.ac.uk/ols4/ontologies/ncit Common Derived Cell Line (NCIT:C156445), Metastatic Tumor Sample (NCIT:C156440), Sample Derived from New Primary (NCIT:C156441), Tumor-Adjacent Normal Specimen (NCIT:C164032), Tumor Tissue (NCIT:C18009), Normal Tissue Segment (NCIT:C162623), Cell Line-Derived Xenograft (NCIT:C156443). Requis si la désignation du tissu du participant est 'Normal' ou 'Tumor'.
cancer_biospecimen_anatomic_location_source_text
Site anatomique d'où le spécimen biologique a été collecté (spécifique) au cancer
Core
Conditional
TEXT
Utilisez le terme inscrit au moment de la collecte du spécimen biologique. Fournir les valeurs en majuscule en début de chaque mot (Title Case). Requis si la désignation du tissu du participant est 'Normal' ou 'Tumor'.
cancer_biospecimen_anatomic_location_ncit_code
Indiquer le code NCIT représentant la localisation anatomique du spécimen biologique
Core
Conditional
TEXT
Values must meet the regular expression
Référez-vous au NCI Thesaurus (NCIt) http://purl.obolibrary.org/obo/ncit.owl. L'ontologie peut être consultée à https://www.ebi.ac.uk/ols4/ontologies/ncit . Requis si la désignation du tissu du participant est 'Normal' ou 'Tumor'.
tumor_histological_type_source_text
Histologie du néoplasme, selon le rapport de pathologie
Core
Conditional
TEXT
Si le spécimen biologique est une tumeur, veuillez utiliser le terme fourni dans le rapport de pathologie. Fournir les valeurs en majuscule en début de chaque mot (Title Case). Requis si la désignation du tissu du participant est 'Normal' ou 'Tumor'.
tumor_histological_type_ncit_code
Code histologique du néoplasme selon le NCI Thesaurus (NCIt)
Core
Conditional
TEXT
Values must meet the regular expression
Si le spécimen biologique est une tumeur, référez-vous au NCI Thesaurus (NCIt) http://purl.obolibrary.org/obo/ncit.owl. L'ontologie peut être consultée à https://www.ebi.ac.uk/ols4/ontologies/ncit . Requis si la désignation du tissu du participant est 'Normal' ou 'Tumor'.

Diagnosis (diagnosis)

17 Champs
Ensemble de champs reliés aux diagnostics du participant. Pour soumettre plus d'un diagnostic pour un participant, veuillez ajouter des lignes dans la table diagnostic pour ce participant.
Exemple de nom de fichier: diagnosis[-optional-extension].tsv
Champ et description
Niveau de données
Attributs
Type
Valeurs permises
Notes et scripts
study_id
Identifiant pour l'étude
ID
Required
TEXT
Values must meet the regular expression
Les caractères alphanumériques ainsi que les points et tirets sont supportés. Maximum de 64 caractères.
submitter_participant_id
Identifiant pour le participant soumis par l'étude
ID
Required
TEXT
Values must meet the regular expression
Les caractères alphanumériques ainsi que les points, tirets et barres de soulignement sont supportés. Maximum de 250 caractères.
diagnosis_source_text
Le diagnostic du participant tel que rapporté par l'étude
Core
Required
TEXT
Veuillez fournir l'information telle qu'elle est rapportée dans l'étude. Fournir les valeurs en majuscule en début de chaque mot (Title Case). Les individus sains peuvent être indiqués par 'No diagnosis - healthy participant'.
diagnosis_molecular_subtype
Sous-type moléculaire de la condition, le cas échéant (par exemple, voie génétique affectée, mutation, etc.)
Core
TEXT
Veuillez fournir le sous-type moléculaire exact tel qu'il est rapporté dans l'étude.
diagnosis_ICD_code
Code utilisé pour définir la maladie selon la CIM-10
Extended
Conditional
TEXT
Values must meet the regular expression
Si diagnosis_mondo_code, diagnosis_ICDO_topography_code, diagnosis_ICDO_morphology_code ne sont pas fournis, fournissez le code exact tel qu'il apparait dans la CIM-10 (2019). L'ontologie peut être consultée à https://www.who.int/fr/standards/classifications/classification-of-diseases. Les individus sains peuvent utiliser le code Z00.00.
diagnosis_mondo_code
Code utilisé pour définir la maladie selon la classification MONDO
Extended
Conditional
TEXT
Values must meet the regular expression
Si diagnosis_mondo_code, diagnosis_ICDO_topography_code, diagnosis_ICDO_morphology_code ne sont pas fournis, fournissez le code tel qu'il apparait dans MONDO. Consultez les codes MONDO https://www.ebi.ac.uk/ols/ontologies/mondo.
diagnosis_ICDO_topography_code
Code topographique de la classification CIM-O utilisé pour définir une condition
Extended
Conditional
TEXT
Values must meet the regular expression
Fournissez le code tel qu'il apparait dans CIM-O. Ex: 'C34.1'. Pour les codes CIM-O, référez-vous à https://www.who.int/standards/classifications/other-classifications/international-classification-of-diseases-for-oncology. Ce champ est requis si ni diagnosis_ICD_code ni diagnosis_mondo_code ne sont fournis, ou si diagnosis_ICDO_morphology_code est fourni.
diagnosis_ICDO_morphology_code
Code de morphologie de la classification CIM-O utilisé pour définir une condition
Extended
Conditional
TEXT
Values must meet the regular expression
Fournissez le code tel qu'il apparait dans CIM-O. Le 6ème chiffre pour la différenciation (ou l'immunophénotype pour les lymphomes et les leucémies) peut être inclus en option. Ex: '8070/33'. Pour les codes CIM-O, référez-vous à https://www.who.int/standards/classifications/other-classifications/international-classification-of-diseases-for-oncology. Ce champ est requis si ni diagnosis_ICD_code ni diagnosis_mondo_code ne sont fournis, ou si diagnosis_ICDO_topography_code est fourni.
age_at_diagnosis
Âge du participant (en jours) au moment du diagnostic de la condition
Core
INTEGER
is_cancer
Indiquer si le diagnostic est un diagnostic de cancer
Core
Required
BOOLEAN
is_cancer_primary
Indiquer si le diagnostic est un diagnostic de cancer primaire
Core
Conditional
TEXT

Yes

No

Unknown

Cette information est requise si le diagnostic est un diagnostic de cancer. Les valeurs possibles sont 'Yes', 'No' ou 'Unknown'.
disease_status
État de la maladie du participant au moment du diagnostic
Extended
TEXT

Complete remission

Distant progression

Loco-regional progression

No evidence of disease

Partial remission

8 more
Plusieurs entrées dans la table pour le même code de diagnostic à différents moments (age_at_diagnosis) peuvent être utilisées pour indiquer la progression ou la rémission de la maladie.
tumor_staging_system
Indiquer le système de stadification du cancer utilisé pour effectué le diagnostic primaire
Core
Conditional
TEXT

AJCC 8th edition

AJCC 7th edition

Ann Arbor staging system

Binet staging system

Durie-Salmon staging system

5 more
Si le diagnostic est un diagnostic de cancer, fournissez l'un des systèmes de stadification suivants : 'AJCC 8th edition', 'AJCC 7th edition', 'Ann Arbor staging system', 'Binet staging system', 'Durie-Salmon staging system', 'FIGO staging system', 'Lugano staging system', 'Rai staging system', 'Revised International staging system (RISS)', 'St Jude staging system'.
stage_group
Stade de la tumeur assigné par le sytème de gradation et indiquant le pronostic (stade I, II, III etc.).
Extended
Conditional
TEXT

Stage 0

Stage 0a

Stage 0is

Stage I

Stage IA

48 more
Les valeurs possibles pour ce champ dépendent du système de stadification utilisé. Les valeurs possibles totales sont les suivantes : 'Stage 0', 'Stage 0a', 'Stage 0is', 'Stage I', 'Stage IA', 'Stage IA1', 'Stage IA2', 'Stage IA3', 'Stage IB', 'Stage IB1', 'Stage IB2', 'Stage IC', 'Stage IS', 'Stage IE', 'Stage II', 'Stage IIA', 'Stage IIA1', 'Stage IIA2', 'Stage IIE', 'Stage IIB', 'Stage IIC', 'Stage III', 'Stage IIIA', 'Stage IIIA1', 'Stage IIIA2', 'Stage IIIB', 'Stage IIIC', 'Stage IIIC1', 'Stage IIIC2', 'Stage IIID', 'Stage IV', 'Stage IVA', 'Stage IVA1', 'Stage IVA2', 'Stage IVB', 'Stage IVC', 'Occult carcinoma', 'Stage 1', 'Stage 1A', 'Stage 1B', 'Stage ISA', 'Stage ISB', 'Stage IEA', 'Stage IEB', 'Stage IIEA', 'Stage IIEB', 'Stage IIES', 'Stage IIESA', 'Stage IIESB', 'Stage IIS', 'Stage IISA', 'Stage IISB', 'Stage IIIE', 'Stage IIIEA', 'Stage IIIEB', 'Stage IIIES', 'Stage IIIESA', 'Stage IIIESB', 'Stage IIIS', 'Stage IIISA', 'Stage IIISB', 'Stage IAB', 'Stage A', 'Stage B' ou 'Stage C'.
t_category
Classification t (tumeur), selon le système de classification des tumeurs cancéreuses solides de l'Union internationale contre le cancer (UICC). La tumeur primitive est définie en fonction de sa taille et de son extension aux tissus avoisinants au moment du diagnostic et est classée de T0 à T4.
Extended
Conditional
TEXT

T0

T1

T1a

T1a1

T1a2

35 more
Ce champs est requis si le système de stadification est une des éditions du manuel AJCC.
n_category
Classification n (nodes = ganglions) selon le système de classification des tumeurs cancéreuses solides de l'Union internationale contre le cancer (UICC). Les ganglions sont classés en fonction de leur nombre, de la taille et de leur extension locale. Ils sont classés de N0 à N3.
Extended
Conditional
TEXT

N0

N0a

N0a (biopsy)

N0b

N0b (no biopsy)

21 more
Ce champs est requis si le système de stadification est une des éditions du manuel AJCC.
m_category
Catégorie m (métastase) selon le système de stadification des tumeurs cancéreuses solides de l'Union internationale contre le cancer (UICC). Les métastases sont classées en fonction de leur absence ou de leur présence au moment du diagnosticet avant le traitement, et se classent de M0 à M1.
Extended
Conditional
TEXT

M0

M0(i+)

M1

M1a

M1a(0)

11 more
Ce champs est requis si le système de stadification est une des éditions du manuel AJCC.

Treatment (treatment)

10 Champs
L'ensemble de champs reliés au traitement d'un participant. Pour soumettre plus d'un traitement pour un participant, veuillez ajouter des lignes dans la table traitement pour ce participant.
Exemple de nom de fichier: treatment[-optional-extension].tsv
Champ et description
Niveau de données
Attributs
Type
Valeurs permises
Notes et scripts
study_id
Identifiant pour l'étude
ID
Required
TEXT
Values must meet the regular expression
Les caractères alphanumériques ainsi que les points et tirets sont supportés. Maximum de 64 caractères.
submitter_participant_id
Identifiant pour le participant soumis par l'étude
ID
Required
TEXT
Values must meet the regular expression
Les caractères alphanumériques ainsi que les points, tirets et barres de soulignement sont supportés. Maximum de 250 caractères.
submitter_diagnosis_id
Identifiant du diagnostic qui est relié à ce traitement
ID
Required
TEXT
Values must meet the regular expression
Les caractères alphanumériques ainsi que les points, tirets et barres de soulignement sont supportés. Maximum de 250 caractères.
treatment_type
Type de traitement reçu par le participant
Core
Required
TEXT

Ablation

Bone marrow transplant

Chemotherapy

Endoscopic therapy

Hormonal therapy

9 more
treatment_is_primary
Indiquer si ce traitement est le traitement de première intention reçu par le participant après son diagnostic
Extended
TEXT

Yes

No

Unknown

treatment_intent
Indiquer l'intention du traitement
Extended
TEXT

Adjuvant

Concurrent

Curative

Life extending

Neoadjuvant

5 more
treatment_description
Informations supplémentaires sur le traitement, telles qu'un protocole, non capturées dans le champ 'treatment_type'
Extended
TEXT
Ce champ est facultatif et peut être utilisé pour fournir plus de contexte sur le traitement.
treatment_response
Indiquer la réponse du participant à ce traitement
Extended
TEXT

Clinical remission

Disease Progression

Partial Response

Stable Disease

Treatment cessation due to toxicity

5 more
age_at_treatment
Âge du participant (en jours) au moment où le traitement a été administré (ou commencé pour les traitements de longue durée)
Extended
Conditional
INTEGER
Ce champ dépend du traitement sélectionné. Fournir un nombre entre 0 et 40000 (inclus) si le treatment_type est 'Chemotherapy', 'Hormonal therapy', 'Immunotherapy', ou 'Other targeting molecular therapy'. Sinon, ce champ doit être laissé vide.
treatment_duration
La période de temps (en jours) pendant laquelle le traitement a été administré.
Extended
Conditional
INTEGER
Ce champ dépend du traitement sélectionné. Fournir un nombre plus grand ou égal à 0 si le treatment_type est 'Chemotherapy', 'Hormonal therapy', 'Immunotherapy', ou 'Other targeting molecular therapy'. Sinon, ce champ doit être laissé vide.

Follow Up (follow_up)

6 Champs
L'ensemble de champs reliés à une visite de suivi du participant ayant un diagnostic de cancer. Un suivi est défini comme tout épisode suivant le diagnostic de cancer. Pour soumettre plus d'un suivi pour un participant, ajouter des lignes à la table suivi de ce participant.
Exemple de nom de fichier: follow_up[-optional-extension].tsv
Champ et description
Niveau de données
Attributs
Type
Valeurs permises
Notes et scripts
study_id
Identifiant pour l'étude
ID
Required
TEXT
Values must meet the regular expression
Les caractères alphanumériques ainsi que les points et tirets sont supportés. Maximum de 64 caractères.
submitter_participant_id
Identifiant pour le participant soumis par l'étude
ID
Required
TEXT
Values must meet the regular expression
Les caractères alphanumériques ainsi que les points, tirets et barres de soulignement sont supportés. Maximum de 250 caractères.
submitter_diagnosis_id
Identifiant pour le diagnostic du participant soumis par l'étude
ID
Required
TEXT
Values must meet the regular expression
Les caractères alphanumériques ainsi que les points, tirets et barres de soulignement sont supportés. Maximum de 250 caractères.
days_to_follow_up
Nombre de jours entre le diagnostic et la visite de suivi
Core
Required
INTEGER
disease_status_at_followup
État de la maladie au moment du suivi
Core
Required
TEXT

Clinical remission

Distant progression

Loco-regional progression

No evidence of disease

Partial remission

2 more
relapse_interval
Intervalle entre la fin du traitement de première intention et la progression de la maladie (en jours)
Extended
Conditional
INTEGER
Ce champ indique la durée de l'intervalle sans maladie en jours dans le cas où la maladie était non-détectée suite au traitement primaire, puis une rechute, une récidive ou une progression (pour les tumeurs liquides) s'est produite par la suite

Exposure (exposure)

5 Champs
L'ensemble de champs reliés à l'exposition à des facteurs de risque pour la santé pour le participant.
Exemple de nom de fichier: exposure[-optional-extension].tsv
Champ et description
Niveau de données
Attributs
Type
Valeurs permises
Notes et scripts
study_id
Identifiant pour l'étude
ID
Required
TEXT
Values must meet the regular expression
Les caractères alphanumériques ainsi que les points et tirets sont supportés. Maximum de 64 caractères.
submitter_participant_id
Identifiant unique pour le participant soumis par l'étude
ID
Required
TEXT
Values must meet the regular expression
Les caractères alphanumériques ainsi que les points, tirets et barres de soulignement sont supportés. Maximum de 250 caractères.
smoking_status
Statut tabagique du participant au moment de la collecte de données
Extended
TEXT

Current every day smoker

Current some day smoker

Former smoker

Never smoker

Smoker, current status unknown

3 more
alcohol_status
Consommation d'alcool actuelle basée sur la limite quotidienne recommandée
Extended
TEXT

No alcohol consumption

Alcohol intake within recommended daily limit

Alcohol intake exceeds recommended daily limit

Alcohol consumption unknown

Référez-vous au Centre canadien sur les dépendances et l'usage de substances. Pour les hommes, pas plus de 15 verres par semaine, avec pas plus de 3 verres par jour la plupart des jours. Pas plus de 4 verres en une seule occasion. Pour les femmes, pas plus de 10 verres par semaine, avec pas plus de 2 verres par jour la plupart des jours. Pas plus de 3 verres par occasion.
FSA
Région de tri d'acheminement (3 premiers caractères du code postal)
Extended
TEXT
Values must meet the regular expression
Région de tri d'acheminement est représenté par les 3 premiers caractères du code postal

Phenotype (phenotype)

6 Champs
L'ensemble de champes reliés aux phénotypes du participant. Pour soumettre plus d'un phénotype, veuillez ajouter des lignes à la table phénotype pour ce participant.
Exemple de nom de fichier: phenotype[-optional-extension].tsv
Champ et description
Niveau de données
Attributs
Type
Valeurs permises
Notes et scripts
study_id
Identifiant pour l'étude
ID
Required
TEXT
Values must meet the regular expression
Les caractères alphanumériques ainsi que les points et tirets sont supportés. Maximum de 64 caractères.
submitter_participant_id
Identifiant pour le participant soumis par l'étude
ID
Required
TEXT
Values must meet the regular expression
Les caractères alphanumériques ainsi que les points, tirets et barres de soulignement sont supportés. Maximum de 250 caractères.
phenotype_source_text
Le phenotype (ou anomalie) du participant tel que rapporté par l'étude
Core
Required
TEXT
Veuillez fournir l'information telle qu'elle est rapportée dans l'étude. Fournir les valeurs avec une majuscule en début de phrase (Sentence case). Les individus sains peuvent être indiqués par 'Healthy'.
phenotype_HPO_code
Code du phénoype du participant selon le système de classification Human Phenoytpe Ontology (HPO)
Core
Required
TEXT
Values must meet the regular expression
Fournissez le code exact tel qu'il apparait dans HPO (par example: HP:0001161. Veuillez-vous référer à https://hpo.jax.org/app/. Les individus sains peuvent utiliser HP:0032322.
age_at_phenotype
Âge du participant (en jours) où le phénotype a été observé chez ce participant
Extended
INTEGER
phenotype_observed
Indiquer si le phénotype est observé
Core
Required
BOOLEAN

Family (family)

6 Champs
L'ensemble de champs reliés aux relation entre les participants d'un même groupe familial. Cette table de données doit être soumise uniquemement si l'étude détient des données sur des groupes de participants qui partagent des liens de parenté (ex: jumeaux, trios).
Exemple de nom de fichier: family[-optional-extension].tsv
Champ et description
Niveau de données
Attributs
Type
Valeurs permises
Notes et scripts
study_id
Identifiant pour l'étude
ID
Required
TEXT
Values must meet the regular expression
Les caractères alphanumériques ainsi que les points et tirets sont supportés. Maximum de 64 caractères.
submitter_family_id
Identifiant pour la famille du participant soumis par l'étude
ID
Required
TEXT
Values must meet the regular expression
Les caractères alphanumériques ainsi que les points, tirets et barres de soulignement sont supportés. Maximum de 250 caractères.
submitter_participant_id
Identifiant unique du participant soumis par l'étude
ID
Required
TEXT
Values must meet the regular expression
Les caractères alphanumériques ainsi que les points, tirets et barres de soulignement sont supportés. Maximum de 250 caractères.
family_type
Type de groupe familial auquel fait partie le participant
Core
Required
TEXT

Case-parent trio

Case-parent duo

Case only

Case-sibling

Twins

3 more
relationship_to_proband
Relation du participant envers le sujet proposant
Core
Required
TEXT

Proband

Mother

Father

Brother

Sister

8 more
is_affected
Est affecté par la condition
Extended
TEXT

Yes

No

Unknown

Family History (family_history)

4 Champs
L'ensemble de champs reliés à l'histoire de santé familiale. Pour soumettre plusieurs conditions de santé pour la famille d'un participant, veuillez ajouter des lignes dans la table histoire familiale.
Exemple de nom de fichier: family_history[-optional-extension].tsv
Champ et description
Niveau de données
Attributs
Type
Valeurs permises
Notes et scripts
study_id
Identifiant pour l'étude
ID
Required
TEXT
Values must meet the regular expression
Les caractères alphanumériques ainsi que les points et tirets sont supportés. Maximum de 64 caractères.
submitter_participant_id
Identifiant pour le participant soumis par l'étude
ID
Required
TEXT
Values must meet the regular expression
Les caractères alphanumériques ainsi que les points, tirets et barres de soulignement sont supportés. Maximum de 250 caractères.
family_condition_name
Nom de la condition médicale observée dans la famille du participant
Core
Required
TEXT
family_condition_relationship
Quelle est la relation de ce membre de la famille envers le participant.
Extended
TEXT

Mother

Father

Brother

Sister

Half-brother

24 more
Référez-vous au système de code HL7 pour identifier un type de relation entre le participant et le membre affecté de sa famille http://terminology.hl7.org/CodeSystem/v3-RoleCode

Sociodemographic Controlled (sociodemographic_controlled)

9 Champs
Données sociodémographiques à accès contrôlé.
Exemple de nom de fichier: sociodemographic_controlled[-optional-extension].tsv
Champ et description
Niveau de données
Attributs
Type
Valeurs permises
Notes et scripts
study_id
Identifiant pour l'étude
ID
Required
TEXT
Values must meet the regular expression
Les caractères alphanumériques ainsi que les points et tirets sont supportés. Maximum de 64 caractères.
submitter_participant_id
Identifiant unique pour le participant soumis par l'étude
ID
Required
TEXT
Values must meet the regular expression
Les caractères alphanumériques ainsi que les points, tirets et barres de soulignement sont supportés. Maximum de 250 caractères.
geographic_location
Code postal du participant à son adresse actuelle de résidence
Extended
TEXT
Values must meet the regular expression
Les valeurs permises sont code postal complet ou la zone de tri d'acheminement (ZTA) (les 3 premiers chiffres), ainsi que les termes de rapport de valeur manquante.
geographic_location_additional
Informations géographiques supplémentaires, telles que la ville ou la région
Extended
TEXT
Lorsque le code postal est moins spécifique, des informations supplémentaires peuvent être fournies.
geographic_location_collect_method
Méthode utilisée pour collecter des informations sur l'emplacement géographique
Extended
Conditional
TEXT

Self-identified

Derived

Missing - Unknown

Missing - Not collected

Missing - Not provided

1 more
Ce champ est requis si 'geographic_location' est fourni. Les valeurs possibles sont 'Self-identified', 'Derived', ou les termes de rapport de valeur manquante ('Missing - Unknown', 'Missing - Not collected', 'Missing - Not provided', 'Missing - Restricted access').
personal_income
Revenu personnel annuel après impôts
Extended
TEXT

Less than $15,000

$15,000 to $19,999

$20,000 to $29,999

$30,000 to $49,999

$50,000 to $69,999

11 more
personal_income_collect_method
Méthode utilisée pour collecter des informations sur le revenu personnel
Extended
Conditional
TEXT

Self-identified

Derived

Missing - Unknown

Missing - Not collected

Missing - Not provided

1 more
Ce champ est requis si 'personal_income' est fourni. Les valeurs possibles sont 'Self-identified', 'Derived', ou les termes de rapport de valeur manquante ('Missing - Unknown', 'Missing - Not collected', 'Missing - Not provided', 'Missing - Restricted access').
education
Le plus haut niveau d'éducation atteint.
Extended
TEXT

No formal education

Elementary school or equivalent

High school (secondary school) diploma or equivalency certificate

Certificate of Apprenticeship, Certificate of Qualification (Journeyperson's designation), or other trades certificate or diploma

College, CEGEP, or other non-university certificate or diploma

11 more
education_collect_method
Méthode utilisée pour collecter des informations sur l'éducation
Extended
Conditional
TEXT

Self-identified

Derived

Missing - Unknown

Missing - Not collected

Missing - Not provided

1 more
Ce champ est requis si 'education' est fourni. Les valeurs possibles sont 'Self-identified', 'Derived', ou les termes de rapport de valeur manquante ('Missing - Unknown', 'Missing - Not collected', 'Missing - Not provided', 'Missing - Restricted access').

Experiment (experiment)

8 Champs
Ensemble de champs reliés à la méthodologies expérimentales effectuées sur un échantillon. Une expérience est un essai ou procédure appliqué à un échantillon afin de générer des données dans le cadre d'une étude. Pour soumettre plusieurs expériences pour une étude, veuillez ajouter plusieurs lignes dans le fichier des expériences pour cette étude. Ce schéma est requis pour une soumission minimale.
Exemple de nom de fichier: experiment[-optional-extension].tsv
Champ et description
Niveau de données
Attributs
Type
Valeurs permises
Notes et scripts
study_id
Identifiant pour l'étude
ID
Required
TEXT
Values must meet the regular expression
Les caractères alphanumériques ainsi que les points et tirets sont supportés. Maximum de 64 caractères.
experiment_name
Nom unique pour l'expérience
ID
Required
TEXT
experimental_strategy
Type d'expérience réalisée dans le cadre de cette étude
Core
Required
TEXT

Whole Exome Sequencing

Whole Genome Sequencing

Targeted Sequencing

RNA-Seq

ChIP-Seq

12 more
Les termes sont adaptés des types d'essais de l'ontologie OBI : https://github.com/obi-ontology/obi/blob/master/src/ontology/templates/assays.tsv. Fournir une liste délimitée par des points-virgules (;).
profiling_resolution
Résolution à laquelle l'échantillon a été profilé
Core
TEXT

Bulk

Pseudo-bulk

Single Cell

Single Nucleus

Spatial

1 more
Fournir une liste délimitée par des points-virgules (;). L'ordre des valeurs doit suivre le même ordre que les valeurs correspondantes dans experimental_strategy.
experimental_category
La catégorie omique générale qui décrit le mieux l'expérience
Core
Required
TEXT

Genomics

Transcriptomics

Epigenomics

Proteomics

Multi-omic

1 more
protocol
Description de la méthodologie expérimentale utilisée pour générer les données
Core
Required
TEXT
Fournissez une description du protocole incluant la préparation de la bibliothèque, les lots d'échantillons, le modèle de la plateforme, le modèle de flow cell, les paramètres utilisés et d'autres détails pertinents. Un lien vers un article ou un site Web existant peut également être fourni.
platform
Nom de la plateforme ou de l'instrument utilisé pour réaliser l'expérience
Core
Required
TEXT

Capillary

DNBSEQ

Element

Helicos

Illumina

9 more
Le modèle de la plateforme ou de l'instrument spécifiquement utilisé doit être fourni dans le champ 'protocol'.
instrument_model
Modèle d'instrument spécifique utilisé pour générer les données
Core
Conditional
TEXT

454 GS

454 GS 20

454 GS FLX

454 GS FLX+

454 GS FLX Titanium

71 more
Les valeurs acceptées dépendent du champ platform. Lorsque platform est 'Comprehensive Assessment of Symptoms and History (CASH)', ce champ devrait être vide. Lorsque plus d'une plateforme est indiquée (e.g. expériences multi-omiques), fournir un instrument_model par plateforme, dans le même ordre que platform.

Sequencing Analysis (sequencing_analysis)

13 Champs
Ensemble de champs reliés à l'analyse de séquençage effectuée sur une expérience. Une analyse de séquençage est toute méthode ou pipeline informatique appliqué aux données brutes de séquençage pour produire des fichiers de données traitées tels que des alignements, des appels de variants ou des quantifications d'expression. Pour soumettre plusieurs analyses de séquençage pour une seule expérience, veuillez ajouter plusieurs lignes dans le fichier des sequencing_analysis pour cette expérience. Ce schéma est requis pour une soumission minimale.
Exemple de nom de fichier: sequencing_analysis[-optional-extension].tsv
Champ et description
Niveau de données
Attributs
Type
Valeurs permises
Notes et scripts
study_id
Identifiant pour l'étude
ID
Required
TEXT
Values must meet the regular expression
Les caractères alphanumériques ainsi que les points et tirets sont supportés. Maximum de 64 caractères.
experiment_name
Nom de l'expérience
ID
Required
TEXT
Les caractères alphanumériques ainsi que les points, tirets et barres de soulignement sont supportés. Maximum de 250 caractères.
analysis_name
Nom unique de l'analyse de séquençage associée à une expérience
ID
Required
TEXT
Les caractères alphanumériques ainsi que les points, tirets et barres de soulignement sont supportés. Maximum de 250 caractères.
analysis_type
Le type d'analyse réalisée en association avec une expérience
Core
Required
TEXT

Germline Variant Analysis

Germline Variant Analysis with Family Joint Genotyping

Somatic Variant Analysis

Multi-omic Analysis

Transcriptome Profiling by High-throughput Sequencing

5 more
Veuillez fournir des informations sur l'objectif ou le résultat de cette analyse de séquençage
selection
Méthode de fragmentation ou sélection de cibles pour la préparation des banques utilisée avant le séquençage
Core
Required
TEXT

ChIP

Reduced Representation

Random

PolyA

PCR

9 more
Utilisez 'Other' lorsque la méthode de sélection utilisée ne figure pas dans la liste. Utilisez 'Unspecified' pour les analyses qui n'ont pas de méthode de sélection spécifique (c.-à-d. N/A).
is_paired_end
S'agit-il d'un séquençage en paires ? Indique si les deux extrémités des fragments d'ADN ont été séquencées.
Core
Conditional
BOOLEAN
Non requis lorsque analysis_type est 'Multi-omic Analysis' ou 'Other'.
read_length
La longueur des lectures de séquençage générées mesurée en paires de bases (pb)
Core
INTEGER
Un nombre compris entre 20 et 200,000 inclusivement. Pour le séquençage en paires, fournissez la longueur de chaque lecture (Ex. 150 pour des lectures de 150 bp). Pour le séquençage PacBio ou Nanopore, indiquez la valeur N50. Exclus : longueurs de code-barres, adaptateur, amorce et lieur.
pore_type
La version de pore associée à la flow cell Nanopore utilisée lors du séquençage (p. ex. DNA R10.4.1, RNA004)
Extended
TEXT
pipelines
Description des flux de travail utilisé(s) pour le traitement des données à des fins d'analyse.
Core
Conditional
TEXT
Values must meet the regular expression
Fournissez le nom complet, la version et l'objectif du pipeline. Incluez les arguments optionnels le cas échéant. Ex : 'DRAGEN GATK v4.3.17 DNA Pipeline for alignment, variant calling and multi-callers (all enabled)'. Ex : 'nf-core/sarek v3.7.1 for alignment and variant calling using bwa2 and haplotypecaller; Ferlab-Ste-Justine/Post-processing-Pipeline v2.9.1'. Fournissez une liste délimitée par des points-virgules (;). Non requis lorsque analysis_type est 'Other'.
genome_build
Version de l'assemblage du génome de référence utilisé dans l'analyse.
Core
TEXT

GRCh37

GRCh38

is_imputed
Indique si l'analyse a produit des données entièrement ou partiellement imputées. L'imputation est le processus d'inférence de valeurs non observées ou manquantes (p. ex. génotypes) à partir d'un panel de référence ou d'un modèle statistique basé sur les observations.
Core
BOOLEAN
Mettre à true lorsque les données sont entièrement ou partiellement imputées (calculées à partir d'observations inférées) ; mettre à false lorsqu'elles reposent uniquement sur des observations directement mesurées.
target_capture_kit
Nom de le kit de capture ciblée utilisé pour le séquençage ciblé
Extended
TEXT
Fournissez la marque et le nom du kit de capture ciblée utilisé pour le séquençage ciblé tel que le séquençage de l'exome complet, le séquençage ciblé, le séquençage ciblé de la méthylation, etc., le cas échéant. Ex., Agilent SureSelect Human all exon V5 +UTR.
targeted_loci
Régions génomiques ciblées dans cette analyse de séquençage
Extended
TEXT
Fournissez les loci ou régions spécifiques ciblés lors du séquençage, le cas échéant. Ex., 'BRCA-related genes'. Si un panneau/kit personnalisé a été utilisé, fournissez une liste des régions ciblées et soumettez un fichier BED décrivant les régions ciblées.

File (file)

8 Champs
Ensemble de champs reliés aux fichiers de données d'un échantillon. Un fichier est tout objet numérique contenant des données, tels que des fichiers de données de séquençage brutes (Ex, FASTQ), des fichiers de données traitées (Ex, BAM, VCF) ou des fichiers de métadonnées. Pour soumettre plusieurs fichiers pour un échantillon, veuillez ajouter plusieurs lignes dans le fichier des files pour cet échantillon. Ce schéma est requis pour une soumission minimale.
Exemple de nom de fichier: file[-optional-extension].tsv
Champ et description
Niveau de données
Attributs
Type
Valeurs permises
Notes et scripts
study_id
Identifiant pour l'étude
ID
Required
TEXT
Values must meet the regular expression
Les caractères alphanumériques ainsi que les points et tirets sont supportés. Maximum de 64 caractères.
submitter_sample_id
Identifiant pour l'échantillon moléculaire soumis par l'étude
ID
Required
TEXT
Values must meet the regular expression
Les caractères alphanumériques ainsi que les points, tirets et barres de soulignement sont supportés. Maximum de 250 caractères.
analysis_name
Nom de l'analyse de séquençage associée à une expérience
ID
Required
TEXT
Les caractères alphanumériques ainsi que les points, tirets et barres de soulignement sont supportés. Maximum de 250 caractères.
submitter_file_name
Chemin d'accès étendu associé à un fichier situé dans le compartiment de stockage temporaire Ceph S3 du fournisseur de données.
ID
Required
TEXT
Values must meet the regular expression
Ce chemin doit inclure le nom du fichier et son extension. Ex: 's3://study123-staging-bucket/chemin/vers/le/fichier.fastq.gz'.
file_size
Taille du fichier en octets (B)
Core
Required
INTEGER
Fournir un nombre entier supérieur à zéro.
file_md5sum
Hachage de contrôle du fichier produit par l'algorithme MD5
Core
TEXT
Values must meet the regular expression
Inclure un hachage de contrôle pour tous les fichiers de données brutes et traitées. Pour les fichiers TGZ et bigWig, ce champ est optionnel mais recommandé.
file_type
Type de fichier soumis
Core
Required
TEXT

FASTQ

CRAM

CRAI

BAM

BAI

16 more
Tous les fichiers de métriques de sortie, fichiers journaux et autres fichiers liés à l'analyse doivent être regroupés dans une archive TGZ par échantillon.
data_type
Type de données contenues dans le fichier
Core
Required
TEXT

Raw Sequencing Reads

Raw Sequencing Reads R1

Raw Sequencing Reads R2

Raw Sequencing Reads I1

Raw Sequencing Reads I2

31 more
Les fichiers Sequencing Data Supplement sont ceux nécessaires pour reproduire les étapes d'analyse de séquençage (ex. : fichiers BED ou d'intervalles pour le séquençage ciblé, protocoles). Les fichiers Quality Control Metrics sont produits lors des analyses afin d'évaluer les alignements, la couverture, la profondeur de lecture et d'autres marqueurs de qualité. Ces deux types de données doivent être soumis en format TGZ (tar.gz) ; tout fichier Quality Control Metrics non associé au file_type TGZ sera compressé avec les autres lors du traitement de la soumission. Les correspondances suivantes par file_type sont couramment observées, sans être des restrictions obligatoires : FASTQ -> Raw Sequencing Reads, Raw Sequencing Reads R1, Raw Sequencing Reads R2, Raw Sequencing Reads I1, Raw Sequencing Reads I2. BAM ou CRAM -> Aligned Reads, Processed Reads, De Novo Assembly Aligned Reads. BAI ou CRAI -> Aligned Reads Index, Processed Reads Index, De Novo Assembly Aligned Reads Index, Unaligned Reads Index. VCF ou gVCF -> Single Nucleotide Variants (SNVs), Insertions and Deletions (InDels), Structural Variations (SVs), Copy Number Variations (CNVs), Joint Genotype SNV, Annotated SNV, Tandem Repeats (TRs). TBI -> Variant Calls Index, Methylation Calls Index, Peak Calls Index. TGZ -> Quality Control Metrics, Sequencing Data Supplement, Secondary Analysis. bigWig -> IGV. BED -> Sequencing Data Supplement, Methylation Calls, Peak Calls, Annotated Peaks. HDF5 -> Raw Feature Count Matrix, Filtered Feature Count Matrix, Raw Peak Barcode Matrix, Filtered Peak Barcode Matrix, Secondary Analysis, Quality Control Metrics. TSV -> Peak Calls, Annotated Peaks. GFF ou GTF -> Gene Annotations. FAM -> Pedigree. POD5 -> Raw Sequencing Reads. CSV -> Sequencing Data Supplement, Quality Control Metrics, Psychiatric Assessment Scores. cloupe -> Secondary Analysis.

Dataset Mapping (dataset_mapping)

3 Champs
L'ensemble de champs liés au mappage des fichiers à un ou plusieurs jeux de données. Une table optionnelle qui lie un (sous-ensemble de) fichier(s) à un jeu de données au sein d'une étude. Cette table est utile lorsqu'une étude contient plusieurs jeux de données (Ex, différentes cohortes de maladies, etc.) et que le fournisseur de données souhaite spécifier quels fichiers appartiennent à quel jeu de données. Si la table n'est pas fournie, aucun fichier ne sera associé à un jeu de données malgré la définition de la table dataset. Chaque ligne de cette table représente un mappage entre un fichier et un jeu de données. Si cette table est soumise, la table dataset doit également être soumise.
Exemple de nom de fichier: dataset_mapping[-optional-extension].tsv
Champ et description
Niveau de données
Attributs
Type
Valeurs permises
Notes et scripts
study_id
Identifiant pour l'étude
ID
Required
TEXT
Values must meet the regular expression
Les caractères alphanumériques ainsi que les points et tirets sont supportés. Maximum de 64 caractères.
submitter_file_name
Chemin d'accès étendu associé à un fichier situé dans le compartiment de stockage temporaire Ceph S3 du fournisseur de données.
ID
Required
TEXT
Values must meet the regular expression
Ce chemin doit inclure le nom du fichier et son extension. Ex: 's3://study123-staging-bucket/chemin/vers/le/fichier.fastq.gz'
dataset_name
Nom du jeu de données
ID
Required
TEXT
Chaque nom de jeu de données doit correspondre à un nom de jeu de données défini dans la table des jeux de données pour cette étude.