Der Juli ist noch nicht vorbei, und die AI-Videogenerierungs-Branche ist bereits extrem heiß.
Vom 3. Juli bis zum 23. Juli, in nur 20 Tagen, haben fünf Unternehmen nacheinander große Finanzierungsrunden bekannt gegeben.
Keling AI
hat 3 Milliarden US-Dollar erhalten, Shengshu Technology 500 Millionen US-Dollar, Aishi Technology in der C+-Runde mehrere hundert Millionen US-Dollar, Zhixiang Future in der C-Runde 1,5 Milliarden RMB, und selbst ein neues Unternehmen namens FlovaAI, das weniger als ein Jahr alt ist, hat 80 Millionen US-Dollar in einer Seed-Runde erhalten.
Die Finanzierungen der ersten vier Unternehmen, die Unicorn-Status erreicht haben, summieren sich auf über 26,2 Milliarden RMB. Das bedeutet, dass allein im Juli 2026 mehr Geld in den Sektor geflossen ist als in den gesamten zwei Jahren zuvor (2024-2025) zusammen.
Warum konzentrieren sich alle auf den Juli für Finanzierungen? Was ist passiert? Das sollte kein Zufall sein.
Keling AI: Historische gemeinsame Investition von BAT, ARR vervierfacht in einem Jahr
Am 3. Juli gab
Keling AI
eine Serie-A-Finanzierung von 3 Milliarden US-Dollar bekannt, angeführt von CPE Yuanfeng und Guofang Innovation, mit 34 institutionellen Investoren – in der Investorenliste tauchten Tencent, Alibaba Cloud und Baidu selten gleichzeitig auf. Guangyuan Capital fungierte als Finanzberater.
Die Obergrenze der Serie-A-Finanzierung von 3 Milliarden US-Dollar entspricht einer Post-Money-Bewertung von etwa 18 Milliarden US-Dollar; der bereits unterzeichnete Teil beträgt etwa 19 Milliarden RMB.
Warum traut sich das Kapital diese Zahl zu? Das liegt am Vertrauen, das der Quartalsbericht von Kuaishou für das erste Quartal 2026 dem Markt gegeben hat.
Der Q1-Bericht von Kuaishou 2026 zeigt, dass
Keling AI
im Einzelquartal einen Umsatz von über 650 Millionen RMB erzielte, ein Wachstum von über 300% im Jahresvergleich. Die annualisierte Umsatzrate (ARR) stieg von 100 Millionen US-Dollar im März 2025 auf fast 500 Millionen US-Dollar im März 2026, eine Vervierfachung im Jahresvergleich.
Diese Zahl ist im AI-Videosegment führend – abgesehen von ByteDances Seedance hat kein anderes Unternehmen in China diese Größenordnung erreicht.
Kelings Umsatz wird von zwei Säulen getrieben: B2B-Kunden-API-Aufrufe + P2P-bezahlte Mitgliedsabonnements. Bis Juni 2026 hat
Keling AI
weltweit über 100 Millionen Nutzer und fast 50.000 Unternehmenskunden. So war Keling tief in die Erstellung virtueller Szenen und Spezialeffekte für die beliebte chinesische historische Serie „Das Jahr des Friedens“ eingebunden und unterstützte die Generierung von Hunderten hochwertiger Aufnahmen in der Hollywood-Serie „Das David-Reich“.
Produktseitig brachte Keling im Februar dieses Jahres die 3.0-Modellreihe auf den Markt, die Videogenerierung von bis zu 15 Sekunden, Storyboard-Steuerung, Subjektkonsistenz und synchronen Audio- und Video-Output ermöglicht.
Bemerkenswert sind zwei Details. Erstens wurde die Bewertung im Vergleich zu den im Mai gemunkelten 20 Milliarden US-Dollar etwas gesenkt, die Preisgestaltung ist pragmatischer, und die Transaktion lief dadurch schneller. Zweitens enthält die Ankündigung eine Earn-out-Klausel – wenn Beijing Keling es nicht schafft, vor Oktober 2031 an die Börse zu gehen, haben Investoren das Recht, eine Rückzahlung zum Nennwert plus 8% jährlichem Zins zu verlangen.
Ausgliederung, Finanzierung, Aktienanreize, Rückkaufklausel – diese Kombination zielt klar darauf ab: Keling bereitet den Weg für einen unabhängigen Börsengang.
Shengshu Technology: 500 Millionen US-Dollar Finanzierung am Vorabend des Börsengangs, vom Videomodell zum „Weltmodell“
Am 6. Juli gab Shengshu Technology eine Serie-B+-Finanzierung von 500 Millionen US-Dollar bekannt.
Aber wenn man den Zeitrahmen verlängert, hat das Unternehmen in 5 Monaten drei Runden abgeschlossen: Im Februar eine Serie-A+-Runde von über 600 Millionen RMB (angeführt von Zhongguancun Science City und Xinglian Capital), im April eine Serie-B-Runde von 2 Milliarden RMB (angeführt von Alibaba Cloud), plus diese Runde im Juli von 500 Millionen US-Dollar, insgesamt über 5 Milliarden RMB.
Drei Runden in 5 Monaten – das Tempo zeigt eines: Das Kapital drängt sich an Bord. Warum die Eile?
Ende März dieses Jahres hat Shengshu Technology die Umwandlung in eine Aktiengesellschaft abgeschlossen – ein Standard-Schritt vor dem Börsengang. Marktgerüchten zufolge könnte das Unternehmen bereits im ersten Halbjahr den IPO-Prozess in Hongkong einleiten. Also steigt das Kapital am Vorabend des Börsengangs ein.
Das Kernprodukt von Shengshu Technology ist
Vidu
, das im Juli 2024 weltweit eingeführt wurde und in drei Jahren zur
Vidu
S1-Version weiterentwickelt wurde – ein Echtzeit-Interaktionsmodell, das Sprachsteuerung von Frames und unbegrenzte Längengenerierung (1 Minute bis 2 Stunden) unterstützt.
Im gesamten Jahr 2025 verzeichnete Shengshu Technology ein Nutzer- und Umsatzwachstum von über 10-fach und generierte insgesamt über 400 Millionen Videos; insbesondere das B2B-Kundenportfolio ist beeindruckend: Im Bereich Werbung und E-Commerce sind JD.com, Alibaba 1688, Amazon, Meituan, Focus Media, BlueFocus, L'Oréal und Anta dabei; im Bereich Film und Animation deckt es Tencent Animation, Yuewen Group, CCTV Animation, iQiyi und Mango TV ab; im Gaming-Bereich bedient es Lilith und 37 Interactive Entertainment.
Shengshu Technology gibt sich nicht mit reiner Videogenerierung zufrieden und erweitert sich dieses Jahr in Richtung verkörperte Intelligenz.
Im April 2026 veröffentlichte Shengshu Technology offiziell das universelle Weltaktionsmodell Motubrain, das den technologischen Weg des World Action Model (WAM) verfolgt, Wahrnehmung, Vorhersage und Aktion in einem Modell vereint und Robotern die Fähigkeit „ein Gehirn, das voraussieht“ und „ein Gehirn, das vieles kann“ verleiht. Gleichzeitig trat die kommerzielle Version von MotuBrain in die industrielle Validierungsphase ein.
Dieses Tsinghua-verbundene Unternehmen, das erst 3 Jahre alt ist, entwickelt sich rasant von einem „Videomodell-Unternehmen“ zu einer „universellen Weltmodell-Plattform“. Nach Eingang der 500 Millionen US-Dollar wird das Kapital hauptsächlich in die Forschung und Entwicklung des „universellen Weltmodells“ fließen.
Das ist die Geschichte, auf die das Kapital wirklich setzt.
Aishi Technology: Drei Jahre Unicorn, 150 Millionen Nutzer weltweit
Am 14. Juli wurde die C+-Runde von Aishi Technology von Alibaba angeführt. Zusammen mit der im März abgeschlossenen C-Runde von 300 Millionen US-Dollar (angeführt von CDH Investments, mit Beteiligung von fast 20 Investoren wie China Ruyi und 37 Interactive Entertainment) beläuft sich die gesamte C-Runde auf 2,98 Milliarden RMB, mit einer Post-Money-Bewertung von über 2 Milliarden US-Dollar.
Alibaba hatte bereits im September 2025 die Serie-B-Runde von Aishi in Höhe von 60 Millionen US-Dollar angeführt und setzt nun mit der C+-Runde fort. Auch die Ant Group hatte bereits im April 2024 die Serie-A2-Runde von über 100 Millionen RMB angeführt.
Die kontinuierlichen Investitionen der Alibaba-Gruppe in Aishi zeigen, dass sie Aishi als strategischen Punkt im AI-Videosektor betrachtet.
Bis März 2026 hat Aishi Technology weltweit über 150 Millionen Nutzer, 15 Millionen monatlich aktive Nutzer und eine annualisierte wiederkehrende Umsatzrate (ARR) von 40 Millionen US-Dollar erreicht.
Interessanterweise verriet Mitgründer Xie Xuzhang, dass die Trainingskosten für Modelle der gleichen Klasse bei AiShi nur etwa 10 % der Konkurrenz betragen. Der Schlüssel zu diesem Kostenvorteil liegt in der Auswahl hochwertiger Daten, der Reduzierung ineffektiver Trainingsiterationen und der Nutzung einer optimierten Diffusion-Transformer-Architektur, um die Ressourcennutzung zu verbessern, die Kosten pro Training zu senken und durch die Wiederverwendung von Engineering-Erfahrungen zu realisieren.
Im Januar dieses Jahres veröffentlichte AiShi
PixVerse
R1 und behauptete, das weltweit erste universelle Echtzeit-Weltmodell zu sein, das 1080P unterstützt. Im Gegensatz zur traditionellen „voraufgezeichneten“ Videogenerierung ermöglicht R1 eine „Echtzeit-Dynamikgenerierung“ – Benutzer können während der Videowiedergabe jederzeit neue Anweisungen eingeben, und die Szene kann innerhalb von etwa 0,5 Sekunden einen natürlichen, fließenden Übergang von Licht und Kameraperspektive erreichen.
Der Weg von AiShi unterscheidet sich von anderen Playern: Während andere auf die Generierungsqualität setzen, konzentriert es sich auf die Interaktionsfähigkeit. Nur eine Woche nach der Veröffentlichung von R1 gab China Ruyi eine strategische Partnerschaft mit AiShi bekannt und investierte 14,2 Millionen US-Dollar.
Und der Zweck der jüngsten C+-Finanzierungsrunde ist klar definiert: für die Entwicklung von Basis-Videogenerierungsmodellen, Echtzeit-Weltmodellen und globales Wachstum.
ZhiXiang Future: Neues Einhorn, alternativer Ansatz „Modell + Agent + Hardware“
ZhiXiang Future ist das „neue Einhorn“ auf dieser Liste – nach der C-Runde über 1,5 Milliarden Yuan beträgt die Post-Money-Bewertung über 1 Milliarde US-Dollar. Gründer Mei Tao ist ausländisches Mitglied der Canadian Academy of Engineering und ehemaliger Vizepräsident von JD.com.
Das Unternehmen hat in den letzten drei Monaten drei Finanzierungsrunden mit einem Gesamtvolumen von über 2,1 Milliarden Yuan abgeschlossen.
Am 23. Juli gab ZhiXiang Future die C-Runde über 1,5 Milliarden Yuan bekannt, angeführt vom Sozialversicherungsfonds, dem Sichuan Industrial Revitalization Fund und ICBC Investment, mit Beteiligung von Film- und Fernsehkapital wie dem Shanghai Film New Vision Fund und Huace Film & TV sowie 18 weiteren Institutionen – eine Kombination aus nationalen langfristigen Mitteln, lokalem Staatskapital und Industriekapital, die im KI-Videobereich selten ist.
ZhiXiang hatte bereits im Mai 2024 das weltweit erste öffentlich nutzbare DiT-Architekturmodell für Videogenerierung veröffentlicht und auf der gerade zu Ende gegangenen WAIC 2026 den multimodalen Kreativ-Agenten vivago R1 vorgestellt, der sich auf unbegrenzte Videogenerierung und -bearbeitung konzentriert.
Derzeit decken seine Produkte über 100 Länder ab und bedienen mehr als 50 Millionen Nutzer und 40.000 Unternehmenskunden. Der Jahresumsatz 2025 überstieg 100 Millionen Yuan, und der Umsatz im ersten Quartal 2026 übertraf bereits den des gesamten Vorjahres. Mei Tao erklärte während der Chain Expo 2026, dass das Unternehmen aufgrund der hohen Kosten für das Pre-Training großer Modelle voraussichtlich im Jahr 2029 die monatliche Gewinnschwelle erreichen werde.
Mei Tao sagte auch sehr direkt: „Wir konkurrieren nicht mit ByteDance auf der Basisebene; wir machen kommerzielles Marketing und professionelle Film- und Fernsehkooperation.“
Der Weg von ZhiXiang ist klar: Es vermeidet das direkte Schlachtfeld der großen Player und vertieft sich in vertikale Szenarien. Zuerst baut es mit Bildmodellen eine Nutzerbasis auf und entwickelt sich dann zu Video- und Weltmodellen weiter.
FlovaAI: 80 Millionen US-Dollar in der Seed-Runde, Guo Lies dritter Start
Der Gründer von FlovaAI, Guo Lie, ist ein Name, der in der Geschichte des chinesischen mobilen Internets nicht fehlen darf. 2013 machte Guo Lie Facemeng, dann FaceU, und 2018 wurde das Team für 300 Millionen US-Dollar von ByteDance übernommen. Danach war er bei ByteDance an der Entwicklung von Qingyan-Kamera,
Xingtu
,
Jianying
beteiligt – ja,
Jianying
hat er mitentwickelt.
2025 startete Guo Lie erneut, gründete Shenzhen Yuzhou Technology und brachte im Oktober Flova.ai auf den Markt. Sequoia China, IDG und Sky9 Capital investierten insgesamt über 80 Millionen US-Dollar.
Dass man in der Seed-Runde 80 Millionen US-Dollar gibt, zeigt, dass die Investoren nicht auf das Produkt setzen, sondern auf Guo Lie selbst. Jedes seiner bisherigen C-End-Tool-Produkte wurde zu einem Phänomen-Erfolg.
Flova ist eine KI-native Agentenplattform für Videocreation. Benutzer drücken ihre kreativen Bedürfnisse durch Dialoge aus, und der Agent erledigt den gesamten Prozess von der Drehbucherstellung, Charakterdesign, Storyboard-Design bis hin zur Bild-/Video-/Audiogenerierung und Schnitt-Zeitleisten-Montage.
Im Gegensatz zu den gängigen Canvas-Formen auf dem Markt hat Flova ein „Storyboard“-Arbeitspanel entworfen. Der Agent empfängt Anweisungen im Dialogfeld, der Arbeitsprozess wird auf der linken Storyboard-Seite angezeigt, und der Benutzer sieht das Ergebnis direkt im mittleren Vorschaufenster. Bei Unzufriedenheit kann jederzeit per Doppelklick eingegriffen und geändert werden.
Mehrere frühe Nutzer berichteten, dass Flovas größte Stärke das „Gedächtnis“ sei – nach der Erstellung von über einem Dutzend Folgen kann es sich noch an eine bestimmte Einstellung der ersten Folge erinnern. Diese Fähigkeit zum langen Kontextgedächtnis ist bei ähnlichen Produkten sehr herausragend.
Derzeit verfolgt Flova eine Null-Marge-Strategie. Guo Lie sagte: „In der Entwicklungsphase werden wir versuchen, eine Null-Marge zu erreichen.“ Das Team strebt nicht nach kurzfristigen Einnahmen, sondern konzentriert sich auf die effektive Verbrauchsquote: Wie viel des Token-Verbrauchs wird vom Benutzer als wertvoll erachtet, und wie viel ist verschwendete Ineffizienz aufgrund unzureichender Produktqualität.
Warum drängen sich alle im Juli? Mögliche Gründe
Kommen wir zur Kernfrage: Warum haben diese fünf Unternehmen im Juli fast gleichzeitig Finanzierungsrunden abgeschlossen? Wenn ich alle Informationen zusammenfüge, ergeben sich vier Gründe, die sich gegenseitig verstärken.
Erstens: Der „Sogeffekt“ von ByteDances Seedance zwingt alle zur Beschleunigung.
Seit der Veröffentlichung von ByteDances Seedance 2.0 im Februar dieses Jahres beträgt der monatliche Umsatz über 1 Milliarde Yuan, die Durchdringungsrate in der Kurzfilmindustrie liegt bei etwa 95 %, und gemessen am täglichen Token-Verbrauch hält es über 80 % des Marktanteils.
Volcano Engine hat das MaaS-Umsatzziel für 2026 von 1,5 Milliarden im letzten Jahr auf 15 Milliarden Yuan angehoben – ein zehnfaches Wachstum, fast ausschließlich getragen von einem einzigen Modell, Seedance. Und Seedance 2.1 steht kurz vor der Veröffentlichung, mit einer erwarteten Leistungssteigerung von 20 %, und die Preisuntergrenze der abgespeckten Version liegt bei 0,5 Yuan pro Sekunde.
Wenn ByteDance den Markt mit einer „bahnbrechenden Modellfähigkeit plus Preiskampf“ dominiert, haben andere Spieler, die nicht schnell Geld beschaffen, Rechenleistung horten und Iterationen beschleunigen, möglicherweise nicht einmal die Chance, am Tisch zu bleiben.
Alle suchen nach einem Hebel, um langfristig gegen ByteDance zu bestehen. Aber die Ansätze sind völlig unterschiedlich: Kling geht den Weg der Plattform mit multimodaler Ausrichtung, Shengshu den des technischen Geeks, AiShi den der Echtzeit-Interaktionsdifferenzierung, ZhiXiang den der vertikalen Szenarienvertiefung, und FlovaAI den des Agenten-Workflows.
Das Kapital investiert nicht in dieselbe Geschichte, sondern setzt auf verschiedene technologische Wege und Geschäftsmodelle.
Zweitens: Die Kommerzialisierung hat funktioniert, und das Kapital sieht Ausstiegsmöglichkeiten.
Letztes Jahr diskutierte man noch, ob man mit KI-Videos Geld verdienen kann. Dieses Jahr liegen die Daten vor: Kling ARR fast 500 Millionen US-Dollar, Shengshu 2025 Einnahmen über 10-faches Wachstum, Aishi ARR 40 Millionen US-Dollar, Seedance über 1 Milliarde pro Monat.
Werbung, E-Commerce, Kurzfilme, Spiele, Film und Fernsehen – die Zahlungsszenarien für KI-Videos werden nach und nach validiert. Dieser Zustand der sichtbaren Cashflows ist der direkte Auslöser für den konzentrierten Einstieg von Kapital.
Drittens hat sich die Rennstrecke von der Videogenerierung zum Weltmodell weiterentwickelt, die Erzählung wurde aufgewertet.
In der ersten Jahreshälfte konzentrierte sich die Wettbewerbslandschaft der Basismodelle, und die Mittel des Primärmarktes begannen, nach der nächsten Richtung zu suchen. Multimodale Generierung und Weltmodelle wurden zum Konsensausgang.
Beachten Sie einen Trend: Keines der vier Unternehmen, die massive Finanzierungen erhielten, behauptet, nur Videogenerierung zu betreiben. Kling spricht von einem All-in-One multimodalen Kreativ-Workflow, Shengshu von einem universellen Weltmodell und verkörperter Intelligenz, Aishi von einem Echtzeit-Weltmodell und interaktiver Unterhaltung, Zhixiang von einem nativen multimodalen Weltmodell und kausaler Inferenz.
Videogenerierung ist nur der Einstieg, das wahre Endspiel ist das Weltmodell – ein KI-System, das die physische Welt verstehen, schlussfolgern und konstruieren kann. Investoren schauen nicht auf den diesjährigen Markt für Videogenerierung, sondern darauf, wer in drei Jahren das Weltmodell erfolgreich umsetzen kann.
Viertens öffnet sich das Fenster für Börsengänge in Hongkong, das Kapital kämpft um die Fahrkarten.
Im Januar dieses Jahres stiegen die Aktienkurse von Zhipu und
MiniMax
nach der Notierung in Hongkong stark an. Im ersten Quartal erreichte das IPO-Volumen in Hongkong 79 Tage nach Jahresbeginn über 100 Milliarden Hongkong-Dollar, ein historischer Rekord, und mehr als 350 Unternehmen warten auf ihren Börsengang.
Shengshu hat die Aktienreform abgeschlossen, IPO-Gerüchte halten sich hartnäckig; die Ausgliederungsfinanzierung und Rückkaufklausel von Kling sind im Wesentlichen Vorboten eines Börsengangs. Die intensive Finanzierung auf dem Primärmarkt dient zu einem großen Teil der Vorbereitung auf den Sekundärmarkt.
Abschließend möchte ich sagen, dass die KI-Video-Rennstrecke nach diesem Juli in die Endrunde eintritt und die Landschaft wahrscheinlich viel klarer wird: Führende Unternehmen haben viel Geld in der Hand und drängen auf den Börsengang, Unternehmen der zweiten Reihe werden durch die Erzählung des Weltmodells neu bewertet, und neue Spieler wie Flova versuchen, mit Agenten das Wettrüsten der Modelle zu umgehen und sich ein Stück vom Kuchen der Anwendungsebene zu sichern.
Das Problem hinter der Aufregung ist jedoch, dass das Geld schnell kommt, aber noch schneller verbrannt wird. Videogenerierung ist die rechenintensivste KI-Kategorie. Über 26 Milliarden klingen beeindruckend, aber verteilt auf die jährlichen Rechnungen der einzelnen Unternehmen sind sie möglicherweise nicht üppig.
Dieser Artikel stammt vom WeChat-Konto "IT-Juzi" (ID: itjuzi521), Autor: Wu Meimei









