mutcleaner.cleaners.rbd_custom_cleaner#
Functions
|
Attach reference sequences to standardized RBD rows. |
|
Mark wild-type RBD records in the mutation column. |
|
Canonicalize RBD target/reference names. |
- mutcleaner.cleaners.rbd_custom_cleaner.add_reference_sequences_by_target(dataset, reference_sequences, name_column='name', sequence_column='sequence', fallback_reference_sequence=None)[source]#
Attach reference sequences to standardized RBD rows.
- Parameters:
dataset (
DataFrame) – Input RBD dataset.reference_sequences (
Dict[str,str]) – Mapping from target/reference names to RBD reference sequences.name_column (
str) – Column containing target/reference names.sequence_column (
str) – Output column for reference sequences.fallback_reference_sequence (
Optional[str]) – Sequence used when a target/reference name is missing fromreference_sequences.
- Return type:
DataFrame- Returns:
Dataset with the reference sequence column attached.
- mutcleaner.cleaners.rbd_custom_cleaner.mark_wild_type_in_mut_info(dataset, mutation_column='mut_info', variant_class_column='variant_class')[source]#
Mark wild-type RBD records in the mutation column.
- Parameters:
dataset (
DataFrame) – Input RBD dataset.mutation_column (
str) – Column containing mutation descriptions.variant_class_column (
str) – Column indicating whether a row is wild type.
- Return type:
DataFrame- Returns:
Dataset where wild-type rows have
mutation_columnset to"WT".
- mutcleaner.cleaners.rbd_custom_cleaner.standardize_rbd_target_names(dataset, target_name_aliases, name_column='name')[source]#
Canonicalize RBD target/reference names.
- Parameters:
dataset (
DataFrame) – Input RBD dataset.target_name_aliases (
Dict[str,str]) – Mapping from alias names to canonical target names.name_column (
str) – Column containing the target/reference name.
- Return type:
DataFrame- Returns:
Dataset with canonicalized target/reference names.