OpenAI bringt Sora auf den Markt: einen bahnbrechenden KI-Videogenerator

In einer zunehmend videobasierten Welt werden Tools zur Videoerstellung und -bearbeitung immer wichtiger. Allerdings ist der Videobearbeitungsprozess immer noch komplex und zeitaufwändig, insbesondere für Anfänger.

Während sich die Geschwindigkeit der KI-Entwicklung einem Punkt nähert, der über das menschliche Verständnis hinausgeht, ist Sora von OpenAI zur Umwandlung von Textaufforderungen in Videos nur die neueste KI-Technologie, die die Welt schockiert und zu der Erkenntnis führt, dass Dinge früher passieren, als irgendjemand erwartet hätte.

OpenAI Sora ist eine innovative Technologie, die darauf abzielt, Videos auf effiziente und innovative Weise zu konvertieren und zu bearbeiten. Dieses Modell wirft Fragen über das Ausmaß seiner Auswirkungen auf die Videobranche auf und wird es dazu beitragen, die Art und Weise, wie Videos produziert und bearbeitet werden, für immer zu verändern? In diesem Artikel untersuchen wir das Konzept von OpenAI Sora und seine potenziellen Fähigkeiten und werfen einen Blick darauf, wie es sich auf die Videobranche auswirken wird und was diese Innovation für Benutzer und Entwickler gleichermaßen bedeuten könnte. Verifizieren Beste KI-Videogeneratoren (Text zu Video).

Was ist OpenAI Sora?

Wie andere generative KI-Modelle wie DALL-E und MidJourney nimmt Sora Textaufforderungen von Ihnen entgegen und wandelt sie in ein visuelles Medium um. Im Gegensatz zu den oben erwähnten KI-gestützten Bildgeneratoren erstellt Sora jedoch ein Video voller Bewegung, verschiedener Kamerawinkel, Richtungen und allem anderen, was Sie von einem traditionell produzierten Video erwarten würden.

Schauen Sie sich die Beispiele an Sora-Website, sind die Ergebnisse oft nicht von echten, professionell produzierten Videos zu unterscheiden. Alles von High-End-Drohnenaufnahmen bis hin zu vollwertigen Multi-Millionen-Dollar-Filmproduktionen mit Schauspielern, erstellt durch künstliche Intelligenz, Spezialeffekte und die Werke.

Natürlich ist Sora nicht die erste Technologie, die dies tut. Der mit Abstand sichtbarste Anführer in diesem Bereich war RunwayML, die ihre Dienste der Öffentlichkeit gegen eine Gebühr zur Verfügung stellt. Doch selbst unter den besten Umständen sind die Videos von Runway näher an den ersten Generationen als MidJourney-Standbilder. Es gibt keine Bildstabilisierung, die Physik macht keinen Sinn und während ich diesen Artikel schreibe, ist der längste Clip etwa 16 Sekunden lang.

Im Gegensatz dazu ist der beste Wert, den Sora zu bieten hat, absolute Stabilität, mit einer Physik, die sich richtig anfühlt (zumindest für unser Gehirn), und Clips, die bis zu einer Minute lang sein können. Die Clips sind völlig audiofrei, aber es gibt bereits andere KI-Systeme, die das können Musik generieren Soundeffekte und Sprache. Daher habe ich keinen Zweifel daran, dass diese Tools in den Arbeitsablauf von Sora integriert werden können, oder schlimmstenfalls in die traditionelle Voiceover- und Foley-Arbeit. Verifizieren Die interessantesten und unterhaltsamsten KI-Tools zum Ausprobieren.

Es kann gar nicht genug betont werden, was für einen gewaltigen Sprung Sora gegenüber den albtraumhaften KI-Videoaufnahmen von nur einem Jahr vor der Sora-Demo darstellt. Wie das äußerst verstörende KI-Video von Will Smith isst Spaghetti. Ich denke, dass dies ein größerer Schock für das System ist als damals, als KI-Bildgeneratoren von einem Scherz zu existenziellem Schrecken in den Herzen bildender Künstler wurden.

Sora wird wahrscheinlich Auswirkungen auf die gesamte Videobranche haben, von Einzelfilmern bis hin zu Großprojekten von Disney und Marvel. Nichts wird das überleben. Ich denke, das gilt insbesondere, da Sora keine Dinge aus ganzen Stoffen erstellen muss, sondern mit vorhandenen Materialien arbeiten kann, beispielsweise durch die Animation eines von Ihnen bereitgestellten Standbilds. Dies könnte der eigentliche Beginn des KI-Filmemachens sein.

Wie funktioniert Sora?

Wir werden uns so weit wie möglich mit Soras Charakter befassen, aber es ist nicht möglich, so sehr ins Detail zu gehen. Erstens ist OpenAI ironischerweise nicht offen über das Innenleben seiner Technologie. Da es urheberrechtlich geschützt ist, ist uns die geheime Sora, die Sora von der Konkurrenz unterscheidet, bis ins kleinste Detail unbekannt. Zweitens bin ich kein Informatiker, und vielleicht sind Sie auch kein Informatiker, daher können wir die Funktionsweise dieser Technologie nur in groben Zügen verstehen.

Die gute Nachricht ist, dass es eine hervorragende Komplettlösung für Sora (abonnementgeschützt) von gibt Mike Young Auf Medium, basierend auf Technischer Bericht von OpenAI Das wurde detailliert beschrieben, damit wir, die einfachen Leute, es verstehen können. Obwohl es sich lohnt, beide Dokumente zu lesen, können wir hier die wichtigsten Fakten extrahieren.

Sora basiert auf den Erkenntnissen, die OpenAI bei der Erstellung von Modellen wie ChatGPT oder DALL-E gewonnen hat. OpenAI hat erfunden, wie man Sora anhand von Beispielvideos trainieren kann, indem es diese Videos in „Patches“ segmentiert, die den „Tokens“ ähneln, die vom ChatGPT-Trainingsmodell verwendet werden. Da diese Token alle die gleiche Größe haben, spielen Dinge wie Cliplänge, Seitenverhältnis und Auflösungsgröße für Sora keine Rolle.

Sora verwendet denselben umfassenden Transformatoransatz, der GPT antreibt, kombiniert mit der Ausbreitungsmethode, die von KI-Bildgeneratoren verwendet wird. Während des Trainings betrachtet es teilweise verbreitete Patch-Tokens aus einem Video und versucht vorherzusagen, wie ein rauschfreies Token aussehen würde. Durch den Vergleich mit der Grundwahrheit lernt das Modell die „Sprache“ des Videos. Aus diesem Grund sind die Beispiele von Sora-Website Es sieht sehr originell aus.

Abgesehen von dieser großartigen Fähigkeit verfügt Sora auch über sehr detaillierte integrierte Anmerkungen für die Videobilder, an denen er trainiert wurde, was einer der Gründe dafür ist, dass er die von ihm erstellten Videos basierend auf Textaufforderungen bearbeiten kann.

Soras Fähigkeit, die Physik in Videos genau zu simulieren, scheint ein neues Merkmal zu sein, das einfach aus seinem Training mit Millionen von Videos resultiert, die Bewegungen enthalten, die auf der realen Physik basieren. Sora verfügt über eine hervorragende Objektstabilität, sodass das Objekt, wenn es den Rahmen verlässt oder durch etwas anderes innerhalb des Rahmens blockiert wird, dort bleibt und ohne Störung zurückkehrt.

Allerdings gibt es manchmal immer noch Probleme, wenn Objekte im Video mit der Kausalität und der automatischen Objekterstellung interagieren. Etwas komisch ist auch, dass Sora von Zeit zu Zeit links und rechts zu verwechseln scheint. Allerdings ist das bisher Gezeigte nicht nur tatsächlich nutzbar, sondern durchaus auf dem neuesten Stand der Technik.

Wann ist Sora zugänglich?

Daher freuen wir uns alle sehr darauf, Sora zu testen, und Sie können sicher sein, dass ich es verwenden und darüber schreiben werde, wie gut diese Technologie ist, wenn sie uns keine punktgenauen Ergebnisse liefert, dies aber, wenn sie es könnte, tun wird es passiert?

Zum jetzigen Zeitpunkt ist nicht genau klar, wie lange es dauern wird, bis Sora für die breite Öffentlichkeit verfügbar ist, oder wie viel der Zugriff darauf kosten wird. OpenAI sagte, dass das Modell in den Händen des „Roten Teams“ liege, einer Gruppe von Leuten, deren Aufgabe es ist, Sora dazu zu bringen, all die bösen Dinge zu tun, die er nicht tun sollte, und dann dabei zu helfen, Schutzmaßnahmen gegen solche Dinge zu errichten. Die Sache passiert, wenn echte Kunden es nutzen können. Dazu gehört die Möglichkeit, irreführende Informationen zu erstellen, beleidigendes oder beleidigendes Material zu erstellen und viele andere Verstöße, die man sich vorstellen kann.

Zum jetzigen Zeitpunkt liegt es auch in den Händen ausgewählter Inhaltsersteller, was meiner Meinung nach zu Testzwecken dient und um einige Bewertungen und Genehmigungen Dritter einzuholen, während wir auf dem Weg zur endgültigen Veröffentlichung sind.

Unterm Strich wissen wir nicht genau, wann es verfügbar sein wird, so wie man für die Nutzung von DALL-E 3 bezahlen kann, und tatsächlich hat selbst OpenAI noch kein genaues Datum. Dies liegt einfach daran, dass Sicherheitstester möglicherweise Probleme entdecken, deren Behebung länger als erwartet dauert, was die Veröffentlichung verzögert.

Die Tatsache, dass sich OpenAI bereit fühlt, Sora zur Schau zu stellen und sogar einige koordinierte öffentliche Ansprüche geltend zu machen, indem Safety erkannt wurde, kann niemand mit Sicherheit sagen. Ich denke, wir reden hier von Monaten, nicht von Jahren, aber erwarten Sie das nicht nächste Woche. Sie können es jetzt ansehen Ethische KI-Tools für Künstler und Kreative.

Nach oben gehen