mutcleaner.cleaners.proteingym_dms_substitutions_custom_cleaners#

Functions

read_proteingym_dms_substitutions_data(data_path)

Read and combine multiple ProteinGym datasets from a directory or zip file.

mutcleaner.cleaners.proteingym_dms_substitutions_custom_cleaners.read_proteingym_dms_substitutions_data(data_path)[source]#

Read and combine multiple ProteinGym datasets from a directory or zip file.

ProteinGym datasets are stored as individual CSV files, one per protein. This function combines them into a single DataFrame for unified processing. Each file contains columns: mutant, mutated_sequence, DMS_score, and various prediction methods.

Parameters:

data_path (Union[str, Path]) – Path to directory containing ProteinGym CSV files or path to zip file

Return type:

Tuple[DataFrame, DataFrame]

Returns:

(success_dataframe, failed_dataframe) - successfully processed data and failed file info

Raises:
  • FileNotFoundError – If data_path does not exist

  • ValueError – If no CSV files found or required columns missing

Examples

Process directory of ProteinGym CSV files: >>> success_df, failed_df = read_proteingym_dms_substitutions_data(“DMS_ProteinGym_substitutions/”)

Process zip file: >>> success_df, failed_df = read_proteingym_dms_substitutions_data(“DMS_ProteinGym_substitutions.zip”)