Επεξεργασία φωνητικών με τεχνητή νοημοσύνη: Πώς να κάνετε τις φωνές με τεχνητή νοημοσύνη να ακούγονται πιο φυσικές στη μίξη

Η επεξεργασία φωνητικών με τεχνητή νοημοσύνη σημαίνει: τροποποίηση μιας φωνής τεχνητής νοημοσύνης—του τραγουδιού τεχνητής νοημοσύνης από τα Suno, Udio ή ElevenLabs—με τέτοιο τρόπο ώστε η mischiότι ακούγεται φυσικό και ζωντανό. Τυπικά προβλήματα περιλαμβάνουν έντονες υψηλές συχνότητες, μεταλλικό συρισμό, έλλειψη αναπνοής και την περίφημη «ταλάντωση της τεχνητής νοημοσύνης». EQΜε de-esser, συμπίεση, κορεσμό και κάποια χειροκίνητη επεξεργασία, μπορείτε να αποκτήσετε έναν επαγγελματικό ήχο έτοιμο για μίξη από μια φωνή AI.

Περιεχόμενα αυτού του άρθρου

Γιατί τα φωνητικά με τεχνητή νοημοσύνη εντυπωσιάζουν — και όμως ακούγονται τεχνητά

Οι φωνές τεχνητής νοημοσύνης από εργαλεία όπως το Suno, το Udio ή το ElevenLabs έχουν γίνει εκπληκτικά καλές σε σύντομο χρονικό διάστημα. Χτυπούν καθαρά τονικούς τόνους, ακούγονται στυλιστικά κατάλληλα και προσφέρουν ένα ολοκληρωμένο φωνητικό κομμάτι σε δευτερόλεπτα. Παρ' όλα αυτά, οι περισσότεροι ακροατές διαισθάνονται ενστικτωδώς ότι κάτι δεν πάει καλά. Η φωνή ακούγεται ταυτόχρονα τέλεια και άψυχη.

Αυτό δεν οφείλεται σε ένα μόνο σφάλμα, αλλά σε έναν συνδυασμό μικρών ελαττωμάτων. Τα φωνητικά με τεχνητή νοημοσύνη παρουσιάζουν τυπικά «ενδεικτικά»: μια ψηφιακή ταλάντωση σε μακριές, παρατεταμένες νότες (συχνά αποκαλούμενη «ταλάντωση τεχνητής νοημοσύνης»), άκαμπτη, λαχανιασμένη φράση και μια μεταλλική, σχεδόν κρυστάλλινη ευκρίνεια στους ήχους σ και τιν. Σε αυτό προστίθενται το τεχνητό βιμπράτο, οι αφύσικες μεταβατικές τάσεις και, πάνω απ' όλα, η έλλειψη μικροδυναμικής.

Η γνήσια συστροφή ποικίλλει από λέξη σε λέξη. Από την άλλη πλευρά, η συστροφή που δημιουργείται από την τεχνητή νοημοσύνη ακούγεται συχνά σαν να έχει αντιγραφεί και επικολληθεί—πάντα με την ίδια σκληρότητα. Ακριβώς αυτή την ομοιομορφία αναγνωρίζουν τα αυτιά μας ως «συνθετική». Τα καλά νέα: σχεδόν όλα αυτά τα προβλήματα μπορούν να μετριαστούν με κλασικά εργαλεία μίξης. Η επεξεργασία φωνητικών με τεχνητή νοημοσύνη έχει επομένως λιγότερο να κάνει με τη μαγεία και περισσότερο με την επιδέξια τεχνική. Αν διαχωρίζετε επίσης τα κομμάτια σας από το Suno, ο οδηγός μας θα σας βοηθήσει με το πώς να το κάνετε αυτό. Πώς να ανακατέψετε σωστά τα στελέχη Suno Μπορείτε, ως ένα λογικό πρώτο βήμα.

Formants, vibrato και transients: τα ανεπαίσθητα αντικείμενα τεχνητής νοημοσύνης

Πριν φτάσουμε στα εργαλεία, αξίζει να κατανοήσουμε τα τρία πιο ανεπαίσθητα αντικείμενα τεχνητής νοημοσύνης — επειδή η αναγνώρισή τους είναι η μισή μάχη.

Τα πρώτα είναι σχηματιστέςΤα φορμάντια είναι τα σταθερά εύρη συντονισμού στο φωνητικό ηχόχρωμα που καθιστούν ένα φωνήεν αναγνωρίσιμο ως "Λα" ή "Ι" και διαμορφώνουν τον τόνο του. Οι γεννήτριες τεχνητής νοημοσύνης μερικές φορές μετατοπίζουν αυτά τα φορμάντια αφύσικα—η φωνή ακούγεται τότε κούφια ή παράξενα τεταμένη. Ένας ανεπαίσθητος μετατοπιστής φορμάντων ή ένας δυναμικός ισοσταθμιστής στην περιοχή από 800 Hz έως 3 kHz μπορεί να αντισταθμίσει αυτό. Η υπερβολική διόρθωση οδηγεί γρήγορα σε έναν ήχο "Μίκυ Μάους".

Το δεύτερο είναι το τεχνητό βιμπράτοΈνας πραγματικός τραγουδιστής διαμορφώνει τον τόνο του ελαφρώς ακανόνιστα. Το βιμπράτο με τεχνητή νοημοσύνη, από την άλλη πλευρά, είναι συχνά μηχανικά ομοιόμορφο. Μπορεί να αποδυναμωθεί ή να μετατοπιστεί σε συγκεκριμένα σημεία χρησιμοποιώντας ένα εργαλείο τόνου.

Τα τρίτα είναι αφύσικες παροδικές καταστάσεις — η σύντομη φάση επίθεσης στην αρχή ενός ήχου. Με τα φωνητικά τεχνητής νοημοσύνης, οι αρχές των λέξεων μερικές φορές ακούγονται πολύ σκληρές ή πολύ θολές, ειδικά με σκληρά σύμφωνα όπως "T", "K" και "P". Ένας παροδικός σχεδιαστής εξομαλύνει σκόπιμα αυτές τις φάσεις επίθεσης. Μαζί με την έλλειψη μικροδυναμικής, αυτές οι λεπτομέρειες είναι ακριβώς αυτό που καθορίζει αν "ακούγεται ανθρώπινο" ή "ακούγεται μηχανής".

Βήμα 1: Ισοσταθμιστής έναντι έντονων υψηλών και συντονισμών

Όταν επεξεργάζεστε φωνητικά με τεχνητή νοημοσύνη, ξεκινάτε πρώτα με το EQΠριν κάνετε κάτι «πιο όμορφο», πρέπει να τακτοποιήσετε τα πράγματα. Τα φωνητικά με τεχνητή νοημοσύνη συχνά έχουν μια υπερβολικά τονισμένη περιοχή υψηλών συχνοτήτων, η οποία γρήγορα γίνεται σκληρή και κουραστική σε μια πλήρη μίξη. Ένας χειρουργικός ισοσταθμιστής είναι το πιο σημαντικό σας εργαλείο εδώ. Μάθετε περισσότερα στο σεμινάριό μας: Ρυθμίστε σωστά το EQ.

Ξεκινήστε με ένα φίλτρο χαμηλών συχνοτήτων: Μπορείτε να φιλτράρετε οτιδήποτε βρίσκεται κάτω από περίπου 80 έως 100 Hz για τις περισσότερες φωνές τεχνητής νοημοσύνης χωρίς να κάνετε τη φωνή να ακούγεται λεπτή. Στη συνέχεια, χρησιμοποιήστε ένα στενό φίλτρο καμπάνας για να αναζητήσετε ανεπιθύμητους συντονισμούς. Τυπικές προβληματικές περιοχές είναι περίπου 2 έως 4 kHz (ρινικές, σκληρές) και περίπου 6 έως 9 kHz (γυαλιστερές, αιχμηρές). Ενισχύστε για λίγο απότομα ένα στενό εύρος, σαρώστε τη συχνότητα μέχρι να ακούγεται πιο δυσάρεστη — και στη συνέχεια μειώστε την κατά 2 έως 5 dB σε αυτό το σημείο.

Να είστε προσεκτικοί με τις ευρείες ενισχύσεις των πρίμων: Αυτό που προσθέτει "αέρα" σε μια πραγματική φωνή συχνά τονίζει τα τεχνουργήματα σε μια φωνή τεχνητής νοημοσύνης. Μόνιμη Αντηχήσεις, τα οποία επικαλύπτονται με άλλα ίχνη, αποτελούν περίπτωση Απόκρυψη συχνότητας — εδώ αξίζει να αντιστοιχίσουμε τις φωνητικές συχνότητες με την ορχηστρική, αντί να εξετάσουμε τη φωνή μεμονωμένα.

Βήμα 2: Απολύμανση κατά των τεχνητών αλοιφών

Κατά την επεξεργασία φωνητικών με τεχνητή νοημοσύνη, ένας αποσυμπιεστής είναι σχεδόν πάντα απαραίτητος—και θα τον χρησιμοποιήσετε πολύ πιο επιθετικά από ό,τι με μια ανθρώπινη ηχογράφηση. Στην ουσία του, ένας αποσυμπιεστής είναι ένας επιλεκτικός συχνότητας... Συμπιεστής, το οποίο παρεμβαίνει μόνο όταν οι έντονοι ήχοι S, Z, T και Sh γίνουν πολύ δυνατοί.

Χαλάρωση στην κονσόλα μίξης: τιθασεύοντας τους σκληρούς συρισμούς των φωνητικών με τεχνητή νοημοσύνη κατά την μίξη φωνητικών

Ως σημείο εκκίνησης: Για φωτεινές ή γυναικείες φωνές τεχνητής νοημοσύνης, το εύρος-στόχος είναι συνήθως μεταξύ 6 και 8 kHz, ενώ για ανδρικές ή βαθύτερες φωνές είναι πιθανότερο μεταξύ 5 και 7 kHz. Ορίστε μια μείωση περίπου 4 έως 7 dB και ακούστε προσεκτικά: Συριγμοί Θα πρέπει να γίνουν πιο μαλακά χωρίς η φωνή να γίνει συριγμώδης.

Ωστόσο, ένας μόνο de-esser είναι συχνά ανεπαρκής. Μια αποδεδειγμένη τεχνική είναι η στοίβαξη δύο de-esser με μέτριες ρυθμίσεις αντί για έναν που λειτουργεί δυναμικά. Δώστε προσοχή στην τοποθέτηση: Ένας de-esser πρέπει να τοποθετείται πριν από τις διαδικασίες κορεσμού, διαφορετικά ο κορεσμός θα ενισχύσει το συριστικό ήχο και πριν από τις αποστολές αντήχησης/καθυστέρησης, έτσι ώστε το συριστικό ήχο να μην χαθεί στις ουρές εφέ.

Βήμα 3: Συμπίεση για φυσική μικροδυναμική

Η συμπίεση είναι επίσης ένα βασικό βήμα κατά την επεξεργασία φωνητικών με τεχνητή νοημοσύνη. Οι φωνές με τεχνητή νοημοσύνη προέρχονται συχνά από τη γεννήτρια που είναι ήδη σε μεγάλο βαθμό ομαλοποιημένη—η ένταση είναι ομοιόμορφη, αλλά αυτό ακριβώς στερεί τη ζωντάνια της φωνής. Το κόλπο έγκειται στον τρόπο που κάνετε συμπίεση.

Αντί για έναν μόνο, ανθεκτικό συμπιεστή, συνιστάται η σειριακή συμπίεση: δύο συμπιεστές σε σειρά, ο καθένας από τους οποίους εφαρμόζει μόνο 2 έως 4 dB μείωσης κέρδους. Ο πρώτος πιάνει τις σκληρές κορυφές, ο δεύτερος διαμορφώνει τον τονικό χαρακτήρα. Αυτό διατηρεί τη φωνή συνεπή χωρίς να ακούγεται άψυχη και συμπιεσμένη.

Για την αποκατάσταση της χαμένης μικροδυναμικής, η παράλληλη επεξεργασία βοηθάει: Στείλτε τη φωνή σε ξεχωριστό δίαυλο, συμπιέστε την σε μεγάλο βαθμό και αναμίξτε την διακριτικά με το πρωτότυπο. Αυτό προσθέτει ενέργεια και «απτικότητα» χωρίς να ισοπεδώνει τις φυσικές διακυμάνσεις.

Δεν είστε σίγουροι αν η φωνή σας με τεχνητή νοημοσύνη είναι έτοιμη για μίξη; Στείλτε την σε εμάς — θα την ακούσουμε προσεκτικά κατά τη διάρκεια της ανάλυσης της μίξης.

Βήμα 4: Κορεσμός έναντι του αποστειρωμένου ψύχους AI

Κατά την επεξεργασία φωνητικών με τεχνητή νοημοσύνη, ο κορεσμός είναι ίσως το πιο σημαντικό βήμα για να ακούγονται οι φωνές με τεχνητή νοημοσύνη «ανθρώπινες». Τα φωνητικά με τεχνητή νοημοσύνη συχνά ακούγονται στείρα και ψυχρά επειδή δεν έχουν τις ανεπαίσθητες αρμονικές παραμορφώσεις που εμφανίζονται σε πραγματικές ηχογραφήσεις μέσω μικροφώνων, προενισχυτών και αναλογικών διεργασιών. Ο κορεσμός προσθέτει ξανά αυτές τις αρμονικές αποχρώσεις.

Κορεσμός αναλογικού σωλήνα για φωνητικά AI: ζεστασιά έναντι στείρου ψηφιακού κρύου

Χρησιμοποιήστε τον κορεσμό με φειδώ: Ακόμα και μια μικρή ποσότητα αλλοιώνει αισθητά τον χαρακτήρα. Η κασέτα ολοκληρώνει τις υψηλές συχνότητες και προσθέτει απαλή συμπίεση, ενώ η λυχνία τονίζει τις ομοιόμορφες αρμονικές και ακούγεται "πιο γεμάτος". Επειδή ο κορεσμός ενισχύει τις υψηλές συχνότητες, θα πρέπει να εφαρμόζεται μετά την αποσυμπίεση. Ένα δοκιμασμένο κόλπο είναι ο κορεσμός πολλαπλών ζωνών: Ζεστάνετε τις χαμηλότερες μεσαίες συχνότητες (περίπου 200 έως 800 Hz) για το σώμα και διατηρήστε τις υψηλές καθαρές.

Ελέγξτε μια σύγκριση A/B με το μη επεξεργασμένο σήμα — ο κορεσμός σας βάζει στον πειρασμό να προσθέτετε πάντα «λίγο περισσότερο» μέχρι το μείγμα να γίνει θολό.

Βήμα 5: Αντήχηση και καθυστέρηση για ενσωμάτωση

Μια ξερή φωνή τεχνητής νοημοσύνης αιωρείται αποκομμένη πάνω από το μιξάρισμα. Μόνο τα χωρικά εφέ την τοποθετούν σε ένα πιστευτό περιβάλλον. Ξεκινήστε με ένα μικρό χώρο ή ένα οροπέδιο...Reverb Για μια αίσθηση οικειότητας, χρησιμοποιήστε μια μεγαλύτερη, διακριτική αντήχηση στο φόντο για βάθος. Μπορείτε να βρείτε περισσότερες πληροφορίες σχετικά με τον τρόπο σωστής ρύθμισης της αντήχησης στο άρθρο. Ρυθμίστε την αντήχηση σε 10 βήματα.

Επίσης, φιλτράρετε την αντήχηση με ένα Χαμηλή αποκοπή (από περίπου 300 Hz) και ένα φίλτρο υψηλής αποκοπής (από περίπου 8 kHz) για την αποφυγή θολών ήχων. Μια προκαθορισμένη καθυστέρηση 20 έως 40 χιλιοστών του δευτερολέπτου διατηρεί τη φωνή καθαρή και στο επίκεντρο. Μια καθυστέρηση συγχρονισμένη με το τέμπο του τραγουδιού, ελαφρώς μετατοπισμένη προς τα έξω και σε μειωμένο επίπεδο, προσθέτει κίνηση—χρησιμοποιημένη διακριτικά, η φωνή με τεχνητή νοημοσύνη ακούγεται σαν να ήταν πάντα μέρος του τραγουδιού.

Βήμα 6: Χειροκίνητη επεξεργασία για την αντιμετώπιση της ταλάντωσης της τεχνητής νοημοσύνης και της έλλειψης αναπνοής

Ορισμένα προβλήματα δεν μπορούν να λυθούν με ένα πρόσθετο, αλλά μόνο χειροκίνητα. Η «ταλάντωση τεχνητής νοημοσύνης» —ένα ψηφιακό κυμάτισμα σε μεγάλες νότες— είναι μια τέτοια περίπτωση. Εδώ, βοηθάει να κόψετε το επηρεαζόμενο τμήμα, να το συντομεύσετε ή να το εξομαλύνετε με ένα διακριτικό εργαλείο τονικότητας/χρονισμού. Συχνά, αρκεί απλώς να σβήσει το τελευταίο δευτερόλεπτο μιας ταλαντευόμενης νότας.

Επιπλέον, η έλλειψη αναπνοής είναι το δεύτερο μεγαλύτερο πρόβλημα. Οι πραγματικοί τραγουδιστές αναπνέουν ανάμεσα στις φράσεις—αυτός ο ήχος απουσιάζει σχεδόν εντελώς στις φωνές τεχνητής νοημοσύνης. Ακόμα και μερικοί, ήσυχα τοποθετημένοι πραγματικοί ήχοι αναπνοής στην αρχή των φράσεων μπορούν να ξεγελάσουν το αυτί κάνοντάς το να νομίζει ότι πρόκειται για ανθρώπινη ερμηνεία. Αν προτιμάτε να αντικαταστήσετε εντελώς τη φωνή, θα σας δείξουμε πώς. Αντικαταστήστε το τραγούδι του Suno με τη δική σας φωνή. Μπορείτε. Και για όσους προτιμούν να κλωνοποιήσουν τη δική τους φωνή με τεχνητή νοημοσύνη (κλωνοποίηση φωνής): μια κλωνοποιημένη φωνή χρειάζεται ακριβώς την ίδια επεξεργασία στη συνέχεια, διαφορετικά θα ακούγεται γρήγορα συνθετική χωρίς αποχρωματισμό και κορεσμό.

Η σωστή σειρά: μια φωνητική αλυσίδα για φωνές τεχνητής νοημοσύνης

  • 1. Χειροκίνητη επεξεργασία — Διόρθωση ταλάντωσης τεχνητής νοημοσύνης, συλλαβών που έχουν καταποθεί και φωνών που έχουν πρώτα εισπνοή.
  • 2. Αφαιρετικό EQ — Αφαιρέστε τα φίλτρα αποκοπής χαμηλών συχνοτήτων, τους συντονισμούς και τις έντονες υψηλές συχνότητες.
  • 3. Ντε-Έσερ — Δαμάστε τα τεχνητά sibilants (πριν τον κορεσμό!).
  • 4. Συμπίεση — σειριακή ή παράλληλη για λόγους συνέπειας και μικροδυναμικής.
  • 5. Κορεσμός — Ζεστασιά και αρμονικές αποχρώσεις ενάντια στο στείρο κρύο.
  • 6. Προσθετικό ισοσταθμιστή — προαιρετικό ελαφρύ γυάλισμα.
  • 7. Αντήχηση & Καθυστέρηση (μέσω Αποστολής) — Ενσωμάτωση στον χώρο.

Τελικά, τα φωνητικά που δημιουργούνται από τεχνητή νοημοσύνη δεν είναι πυρηνική επιστήμη—είναι μια συμπαγής φωνητική μίξη με μερικές στοχευμένες εστιάσεις. Όσοι προτιμούν να αφήσουν τις τελευταίες πινελιές σε επαγγελματίες μπορούν να ολοκληρώσουν ολόκληρο το έργο τους με μια έκδοση που δημιουργείται από τεχνητή νοημοσύνη. Κάντε μια μίξη τραγουδιού — Αξιοποιούμε στο έπακρο τα κομμάτια σας με τεχνητή νοημοσύνη. Και μόλις ολοκληρωθεί η μίξη, προχωράμε στο επόμενο βήμα: Μουσική με τεχνητή νοημοσύνη σύμφωνα με τον Suno. να έχεις κατακτήσει.

ΕΠΙΚΟΙΝΩΝΙΑ ΣΑΣ ΜΕ ΤΑ PEAK-STUDIOS

Στείλτε μας τα φωνητικά σας με τεχνητή νοημοσύνη ή ολόκληρο το τραγούδι σας με τεχνητή νοημοσύνη — θα σας δώσουμε μια ειλικρινή αξιολόγηση για το τι μπορεί να επιτευχθεί με τη μίξη. Συνήθως επικοινωνούμε μαζί σας εντός 3 ωρών.

Μπορείτε να επικοινωνήσετε μαζί μας τηλεφωνικά από Δευτέρα έως Παρασκευή από τις 09 π.μ. έως τις 20 μ.μ

Συχνές ερωτήσεις σχετικά με τα φωνητικά με τεχνητή νοημοσύνη και την μίξη με τεχνητή νοημοσύνη

Λόγω μιας σειράς μικρών ανωμαλιών: ψηφιακή ταλάντωση σε παρατεταμένες νότες (ταλάντωση τεχνητής νοημοσύνης), λαχανιασμένη φράση, μεταλλικά, επαναλαμβανόμενα συριστικά και έλλειψη μικροδυναμικής. Τα αυτιά μας αντιλαμβάνονται αυτή την ομοιομορφία ως συνθετική.

Ως σημείο εκκίνησης: 6–8 kHz για φωτεινές ή γυναικείες φωνές, 5–7 kHz για πιο σκούρες ή ανδρικές φωνές, με μείωση 4–7 dB. Με φωνητικά με τεχνητή νοημοσύνη, μπορείτε να είστε πιο επιθετικοί από ό,τι με πραγματικές ηχογραφήσεις, επειδή η συστροφή είναι πιο ομοιόμορφη.

Η προέλευση της τεχνητής νοημοσύνης σπάνια μπορεί να αποκρυφθεί εντελώς, αλλά με EQ, de-esser, συμπίεση, κορεσμό, εφέ δωματίου και κάποια χειροκίνητη επεξεργασία, μπορείτε να πλησιάσετε πολύ κοντά σε ένα πιστευτό, έτοιμο για μίξη φωνητικό.

Η βασική αρχή είναι η ίδια, αλλά χρησιμοποιείτε ορισμένα εργαλεία με μεγαλύτερη συνέπεια - ειδικά την αποσυμπίεση και τον κορεσμό - και επενδύετε περισσότερο στην χειροκίνητη επεξεργασία για να καταπολεμήσετε την ταλάντωση και την έλλειψη αναπνοής της τεχνητής νοημοσύνης.

Επεξεργασία → αφαιρετικό EQ → de-esser → συμπίεση → κορεσμός → προαιρετικό EQ → αντήχηση/καθυστέρηση μέσω αποστολής. Είναι σημαντικό το de-esser να τοποθετείται πριν από τον κορεσμό.

Εικόνα από τον Chris Jones

Chris Jones

Διευθύνων Σύμβουλος – Μηχανικός Μίξης και Mastering. Ιδρυτής των Peak-Studios (2006) και ενός από τους πρώτους παρόχους διαδικτυακών υπηρεσιών για επαγγελματική μίξη και mastering ήχου στη Γερμανία.