mutcleaner.utils.cleaner_workers#

Functions

apply_single_mutation(row_data, ...)

Apply mutations to a single sequence.

infer_single_mutationset(row_data, ...)

Process a single row to infer mutations between WT and mutated sequences.

infer_wt_sequence_grouped(group_data, ...)

Process a single protein group and return list of rows (including WT).

valid_single_mutation(args)

Process a single mutation string.

validate_single_mutation_and_sequence(...)

mutcleaner.utils.cleaner_workers.apply_single_mutation(row_data, dataset_columns, sequence_column, name_column, mutation_column, position_columns, mutation_sep, is_zero_based, mutation_type, alphabet, sequence_class)[source]#

Apply mutations to a single sequence.

Parameters:
  • row_data (Tuple) – Row data from the dataset

  • dataset_columns (Index) – Column names of the dataset

  • sequence_column (str) – Column name containing sequences

  • name_column (str) – Column name containing protein identifiers

  • mutation_column (str) – Column name containing mutation information

  • position_columns (Optional[Dict[str, str]]) – Position column mapping for sequence extraction

  • mutation_sep (str) – Separator for splitting multiple mutations

  • is_zero_based (bool) – Whether the mutation position is zero-based.

  • sequence_class (Type[Union[ProteinSequence, DNASequence, RNASequence]]) – Sequence class to use for mutation application

Return type:

Tuple[Optional[str], Optional[str]]

Returns:

(mutated_sequence, error_message) - either sequence or error, not both

mutcleaner.utils.cleaner_workers.infer_single_mutationset(row_data, dataset_columns, wt_sequence_column, mut_sequence_column, mutation_sep, sequence_class)[source]#

Process a single row to infer mutations between WT and mutated sequences.

This function is designed to be used with parallel processing.

Parameters:
  • row_data (Tuple) – Single row data containing sequence information

  • dataset_columns (Index) – Column names of the dataset

  • wt_sequence_column (str) – Column key for wild-type sequence

  • mut_sequence_column (str) – Column key for mutated sequence

  • mutation_sep (str) – Separator for joining multiple mutations

  • sequence_class (Type[TypeVar(SequenceType, bound= BaseSequence)]) – Sequence class to use for mutation inference

Return type:

Tuple[Optional[str], Optional[str]]

Returns:

(result, error_message) where error_message is None on success

mutcleaner.utils.cleaner_workers.infer_wt_sequence_grouped(group_data, name_column, mutation_column, sequence_column, label_columns, wt_label, mutation_sep, is_zero_based, handle_multiple_wt, sequence_class, alphabet_class)[source]#

Process a single protein group and return list of rows (including WT).

This is a module-level function that processes protein groups independently.

Return type:

Tuple[List[Dict[str, Any]], str]

mutcleaner.utils.cleaner_workers.valid_single_mutation(args)[source]#

Process a single mutation string.

Parameters:

args (Tuple) – (mut_info, format_mutations, mutation_sep, is_zero_based, cache)

Return type:

Tuple[Optional[str], Optional[str]]

Returns:

(formatted_mutation, error_message) - one will be None

mutcleaner.utils.cleaner_workers.validate_single_mutation_and_sequence(row_data, dataset_columns, wt_sequence_column, name_column, mutation_column, mut_sequence_column, mutation_sep, is_zero_based, sequence_class)[source]#
Return type:

Tuple[Optional[str], Optional[str]]