19 sierpnia 2025
Dane proteomiczne oparte na spektrometrii mas są dostępne w otwartych bazach danych i dostępne za pomocą bezpłatnych narzędzi. Biorąc pod uwagę złożoność przeszukiwania i opisywania baz danych, wielu biologom brakuje wiedzy, aby wykorzystać te zestawy danych. W tym miejscu przedstawiamy przewodnik dotyczący korzystania z bezpłatnych narzędzi do podstawowego wyszukiwania danych proteomicznych.
Nasza praca stanowi przewodnik dla biologów do analizy złożonych danych proteomicznych przy użyciu bezpłatnych narzędzi. Naszym celem jest umożliwienie im weryfikowania ustaleń i eksplorowania publicznych zbiorów danych. Wielu biologów nie może korzystać z publicznych danych proteomu z powodu braku jasnego przewodnika.
Nasza praca stanowi pomost między tymi problemami, umożliwiając walidację bez konieczności przeprowadzania nowych eksperymentów z dziką przyrodą. Nasza praca opiera się na bezpłatnym, najnowocześniejszym oprogramowaniu, które jest niezależne od dostawcy. Narzędzia te są szybsze, bardziej czułe i zapewniają bardziej precyzyjne odkrywanie proteomu niż wiele tradycyjnych narzędzi.
Aby rozpocząć, pobierz referencyjny plik proteomu FASTA z bazy danych UniProt . Kliknij przycisk dodaj FAPSA, aby załadować referencyjny plik proteomu do oprogramowania DIA-NN. Wybierz dwie opcje: skrót FASTA do generowania bibliotek wyszukiwania bez biblioteki oraz prognozowanie widm, RT i IM oparte na głębokim uczeniu w sekcji generowania jonów prekursorowych.
Następnie kliknij przycisk uruchom, aby wygenerować przewidywaną bibliotekę spektralną. Usuń zaznaczenie dwóch opcji w sekcji generowania jonów prekursorowych. Kliknij przycisk typu odpowiadający formatowi pliku w sekcji wprowadzania, aby załadować dane DIA.
Teraz ustaw zarówno dokładność masy, jak i dokładność MS1 na zero części na milion w sekcji algorytmu. Dostosuj ustawienia zakresu masy prekursora i fragmentu w sekcji generowania jonów prekursorowych zgodnie z konfiguracją eksperymentalną. Pozostałe ustawienia oprogramowania pozostają niezmienione.
Następnie kliknij przycisk uruchom. Poczekaj, aż zakończ zostanie wyświetlone w interfejsie operacyjnym, co oznacza, że analiza została zakończona. Kliknij ikonę rury frag znajdującą się w folderze bin po instalacji.
Przejdź do karty konfiguracji, aby wyświetlić wszystkie ustawienia zależne. Sprawdź, czy moduły MSFragger, IonQuant, diaTracer, DIA-NN i Python są dostępne w Twoim systemie. Jeśli brakuje jakichkolwiek modułów, kliknij pobierz aktualizację lub pobierz, aby je odzyskać.
Teraz przejdź do zakładki przepływu pracy. Wybierz domyślne z listy rozwijanej przepływu pracy i kliknij załaduj przepływ pracy. Następnie kliknij dodaj pliki, aby wprowadzić ścieżki plików.
Przypisz nazwę eksperymentu i numer repliki biologicznej w obszarze Przypisz pliki lub pozostaw to pole puste. Następnie kliknij zakładkę bazy danych, aby się do niej przełączyć. Załaduj plik FASTA z dysku lub pobierz taki, który odpowiada gatunkowi próbki.
Podczas pobierania wybierz opcje tylko przeglądane sekwencje, dodaj wabiki i dodaj typowe zanieczyszczenia, aby uzyskać prosty przebieg. Kliknij kartę MSFragger, aby zmienić widok. Wybierz domyślną konfigurację zamkniętego wyszukiwania i kliknij załaduj.
W obszarze ustawień dopasowania szczytowego zachowaj wszystkie wartości domyślne. Zarówno w przypadku kalibracji, jak i optymalizacji, wybierz opcję brak, aby skrócić czas przetwarzania. W przypadku trawienia białka dostosuj parametry do wymagań eksperymentu i zachowaj pozostałe ustawienia domyślne.
Teraz przejdź do zakładki walidacji. Usuń zaznaczenie opcji Prognozuj RT i Przewiduj widma, ponieważ te opcje są przeznaczone dla przepływów pracy akwizycji niezależnych od danych. Kliknij zakładkę quant MS1.
Wybierz uruchom MS1 quant, a następnie kliknij load quant defaults. Wybierz ilość jonów i pozostaw wszystkie inne ustawienia z wartościami domyślnymi. Na koniec kliknij kartę uruchamiania, aby kontynuować.
Wybierz żądany katalog wyjściowy i kliknij uruchom, aby rozpocząć analizę danych. U pacjentów z gruczolakorakiem przewodowym trzustki lub PDAC, SERPINA5 i HPSE wykazywały znacznie zmniejszoną ekspresję, podczas gdy FGB wykazywały zwiększoną ekspresję w surowicy w porównaniu z osobami zdrowymi. W próbkach guza raka wątrobowokomórkowego ENO3, PLS3, MTAP, SERPINB9 i ITPR2 wykazywały zmniejszoną ekspresję w stosunku do sparowanych tkanek, podczas gdy ME1, CYP27A1, RPS16 i ATP5PF były znacznie zwiększone.
Wizualizacja mapy cieplnej wykazała konsekwentnie podwyższoną ekspresję białka w surowicy pacjentów z PDAC w porównaniu z osobami zdrowymi. Analiza wzbogacenia ontologii genów surowicy PDAC wykazała istotną regulację w górę procesów związanych z krzepnięciem i hemostazą. Analiza GO guzów raka wątrobowokomórkowego wykazała wzbogacenie w nukleotydy i procesy metaboliczne, w tym metabolizm nukleotydów purynowych i szlaki metaboliczne NAD.
Analiza wzbogacenia szlaku KEGG w surowicy PDAC wykazała znaczącą aktywację szlaku kaskad dopełniacza i krzepnięcia, wraz z degradacją glikozaminoglikanu. Analiza KEG w próbkach guza raka wątrobowokomórkowego wykazała wzbogacenie w sygnalizację PPAR, metabolizm węgla i szlaki chorób neurodegeneracyjnych, choć z mniejszą istotnością statystyczną. Sieć interakcji białko-białko dla podwyższonych białek surowicy PDAC ujawniła centralny klaster obejmujący czynnik krzepnięcia 11, łańcuch beta fibrynogenu i inhibitor proteazy serynowej w osoczu, a także kilka izolowanych białek, w tym HPSE, antygen podobny do CD5 i CRISP3.
Wyświetl pełny transkrypt i uzyskaj dostęp do tysięcy filmów naukowych
Niniejsze badanie stanowi kompleksowy przewodnik dla biologów w zakresie analizy złożonych danych proteomicznych przy użyciu bezpłatnych, najnowocześniejszych narzędzi.
Proteomika oparta na spektrometrii mas odgrywa coraz bardziej centralną rolę w badaniach nad wczesnym odkrywaniem leków oraz w badaniach translacyjnych, jednak złożoność danych i brak dostępnych przepływów pracy ograniczają jej szersze zastosowanie w badaniach i rozwoju (R&D) w sektorze biofarmaceutycznym. Niniejszy artykuł demonstruje, w jaki sposób bezpłatne, niezależne od dostawcy narzędzia obliczeniowe umożliwiają rzetelną analizę i walidację publicznych zbiorów danych proteomicznych, wspierając badania oparte na hipotezach bez konieczności przeprowadzania nowych eksperymentów. Usprawnione przepływy analizy danych zwiększają pewność predykcyjną i ułatwiają porównania między badaniami, co bezpośrednio wpływa na procesy walidacji celów terapeutycznych oraz odkrywania biomarkerów.
Niniejszy schemat obejmuje analizę danych spektrometrii mas na każdym etapie – od wczesnego odkrycia, przez identyfikację wiodących cząsteczek, aż po badania translacyjne, z wykorzystaniem publicznych repozytoriów oraz bezpłatnych narzędzi obliczeniowych.