Principal Data Scientist - Oncology
Johnson & Johnson Innovative Medicine · San Diego, CA · 2 wk ago
HybridEngineering$117k–$201k/yrFull-time
About the role
Johnson & Johnson Innovative Medicine is recruiting for a Principal Data Scientist – Oncology to join our Data Science and Digital Health team. This position will be located at one of our offices in Spring House, PA (preferred), Cambridge, MA, or San Diego, CA (La Jolla area). Consideration may be given for our Titusville and Raritan, NJ locations. This role will play a pivotal part in standardizing and connecting biomedical and clinical data to power analytics, search, and AI across Johnson & Johnson Innovative Medicine.
Responsibilities
- Design and implement a scalable knowledge graph infrastructure focused on data standardization and interoperability for Oncology R&D data.
- Apply graph-based data modeling for efficient Oncology R&D organization, integration, and retrieval to ensure system flexibility and long-term maintainability.
- Work with Data Scientists, Clinical Scientists, and Discovery Scientists to standardize, curate, and create AI-ready datasets.
- Curate and extend ontologies for clear mapping into established biomedical ontologies and controlled terminologies using RDF standards.
- Develop ingestion and curation pipelines to ingest, normalize, and map concepts across data sources using SPARQL/GraphQL/REST services.
- Extend and curate Oncology R&D-relevant ontologies (e.g., diseases, drugs, targets, pathways) and maintain synonyms, cross-references, and provenance.
- Partner with cross-functional teams to enable NLP/RAG over graphs, features for predictive modeling, and terminology services for search and study design tools.
- Collaborate with Data Science & Digital Health colleagues, IT, and DevOps teams to deploy and manage the graph database infrastructure with a focus on high availability, scalability, and recovery operations for Oncology R&D needs.
- Draft and manage documentation, such as data dictionaries, data lineage, and data flow diagrams, to facilitate understanding of the knowledge graph.
Qualifications
- Desired: Ph.D. or Master’s degree in bioengineering, computer science, IT, bioinformatics, physics, mathematics, or related fields, with emphasis on semantic technologies for biomedical applications.
- 5+ years of professional experience in health informatics.
- Demonstrated experience in large-scale knowledge graph construction, ontology development, and integration in pharmaceutical or healthcare domains.
- Programming background in parser combinators, natural language processing, and linked data (RDF Triple Stores and property graphs).
- Proficiency in semantic web technologies (e.g., SPARQL, RDF, OWL) and familiarity with graph databases (Neo4j, Amazon Neptune).
- Proven work with complex biomedical datasets (e.g., clinical, genomics, proteomics).
- Proficiency in various data storage solutions (SQL, key-value, column, document, graph stores) and data modeling techniques (semantic data, ontologies, taxonomies).
- Experience with CI/CD implementations, Git usage, CI/CD stacks (Jenkins, GitLab, Azure DevOps), DevOps tools, metrics/monitoring, and containerization technologies (Docker, Singularity).
- Demonstrated stakeholder management capabilities, including requirements gathering, business analysis, and planning, with the ability to translate discussions into user requirements and project plans.
- Ability to manage multiple projects simultaneously, prioritize work, exhibit organizational skills, and deliver maximum business value.
- Willingness to conduct periodic travel (less than 15% of the time) to conferences and internal meetings.
Skills
- Advanced Analytics
- Coaching
- Critical Thinking
- Data Analysis
- Data Privacy Standards
- Data Quality
- Data Reporting
- Data Savvy
- Data Science
- Data Visualization
- Digital Fluency
- Econometric Models
- Organizing
- Process Improvements
- Strategic Thinking
- Technical Credibility
- Workflow Analysis