Beiträge von Melegrian

    Andere Völker


    Den Anfang macht eine Kurdin, erstellt mit Flow-Images.



    Gewöhne ich mich an ihr, oder kommt sie mir weiterhin übersättigt von Schmuck und Muster vor?
    Bin mir noch nicht sicher.


    Vor zwei Tagen in der Nacht zu gestern über einen Song gestolpert, nein, nicht ganz, zuerst im Shorts-Feeds in den ersten 4 Sekunden nur über eine Stimme. Aber eine Stimme, die sofort etwas auslöst, den berüchtigten Hook (Haken), der über wegwischen oder weiterhören entscheidet. Danach weiterhin die Stimme, aber auch die tiefen dumpfen Bässe, dazu der Blues. Die Quelle, bzw. die eigentliche Sound-Seite, ist bei Shorts in der Regel leicht erreichbar, nur wegen weiterer Einzelheiten musste ich mehrfach nachhaken mit Google und der Google KI. Ist das abgebildete Image Cover "Mountain Blood" nun von einem Album oder von einem kleineren EP, so richtig herausgefunden habe ich es nicht, doch der Titel Gula (Rose) hat es in unter 3 Monaten auf über 6,5 Mio. Aufrufe gebracht, bestätigte damit mein Gefühl nach den ersten vier Sekunden vom Short. Und die Google-KI berichtete zusätzlich, dass er allgemein in Social Media einen Hype auslöste.


    Als Genres zeigte Google hier Genres R&B/Soul, Indische Popmusik, Arabic an.

    R&B = Rhythmus und Blues hört man heraus, den Soul in der Stimme ebenfalls.

    Indische Popmusik, Arabic, letzteres ist ebenfalls herauszuhören. Und was ist mit Indisch?


    Dazu meine die Google KI:

    Fazit: Die Shorts haben recht – es ist im Kern ein moderner Song mit tiefen kurdischen Wurzeln ("Mountain" bezieht sich zudem symbolisch oft auf die kurdische Identität, da die Berge historisch als die einzigen Freunde der Kurden gelten). Die Einordnung unter "Arabic" oder "Indian" ist lediglich das Resultat des Algorithmus, der die verwandten orientalischen Klänge und Tonskalen analysiert hat.


    Aber wie das so ist, ohne eigene Kontrolle sollten keine Angaben einer KI übernommen werden, doch das meiste vom Genre ist halt heraus hörbar.

    Was bei den Shorts bisher nur einmal richtig klappte, ein Video nicht nur in der Region des Uploaders auszuliefern, hat diesmal zwar auf Anhieb geklappt. Sowohl von den Ländern, als auch von den Suchbegriffen. Gestern wunderte ich mich schon, dass die Aufrufe morgens nach 04:00 Uhr aufhörten und nach 22:00 Uhr wieder die erfolgten. Es liegt wohl daran, dass es bei Videos im Querformat keine YouTube Testphase wie bei Shorts gibt.


    Ergebnis von den ersten 24 Stunden, die durchschnittliche Wiedergabezeit ist zu gering, bei den Suchbegriffen sah ich aber einige, bei denen die Wiedergabezeit der Länge des Videos entsprach. Alle zusammen ergibt keine 100 %, was aber noch nie anders bei YT war, weil diese erst aber einer gewissen Mindestmenge erfasst und ausgewertet werden.


    Perfektionist-in

    Bin nur ein alter Mann, der nicht mehr alles ganz so schnell versteht. Perfektionist eigentlich nicht, dafür gibt es ja bei Images die Retusche.

    Mir ist nun aufgefallen, Seedance steht auch in Leonardo zur Auswahl zur Verfügung, weiß aber nicht, wie viele Credits die dafür haben wollen.


    Aber den Prompt für die Charakter-Referenz habe ich heute noch einmal ausprobiert, um aus älteren Bildern von Whisk zwei mit Flow Images zu erstellen. Scheint also beinahe universell von den meisten KIs verstanden zu werden. Kürzt den einführenden Prompt erheblich ab, weil dieser nicht mehr beschrieben werden muss.


    Beispiel eins, hier kam Flow etwas durcheinander, weil ich zwei Images als Ausgangsbilder nahm.




    Besser bei dieser Vorlage:



    Hier gab es keine Missverständnisse, was die Vorlage betrifft. Bin mir aber nicht sicher, ob das mit dem Band am Hinterkopf so getragen wurde, oder nicht eher durchgängig war. Vor Verwendung einmal bei Etsy schauen, die haben ja fast alles da. Und ob so ein Streifen auf dem Rücken gehört, da habe ich ebenfalls leichte zweifle, der sollte sich retuschieren lassen.



    Vorläufig brauche ich beide nicht, doch weglegen kann nicht schaden.

    Funktioniert jedenfalls gut bisher als Prompt, das ist wichtig:


    "Create a professional character turnaround sheet for a young beautiful Baschkirin (Image 1) woman. Plain neutral background.

    Arrange the images in four vertical columns, each representing a different viewing angle. Each column contains a full-body view at the top and a matching detailed portrait directly below.


    Columns (from left to right):

    Column 1: Front view (full body above, portrait below)

    Column 2: Left profile (full body facing left above, portrait facing left below)

    Column 3: Right profile (full body facing right above, portrait facing right below)

    Column 4: Back view (full body above, close-up of the hairstyle/back below)

    Maintain consistent proportions, facial features, clothing details, hairstyle, body shape, and age across all views. Clear silhouette, consistent alignment, clean panel separation, even spacing, and professional character-sheet layout.


    Photorealistic, ultra-detailed, DSLR photography quality, realistic skin texture, natural lighting, muted colors, thin borders, no text, no watermark. Landscape format 16:9"


    "Woman" hätte ich weglassen können, dafür eher "female" mit unterbringen, aber egal, hat ja geklappt. Das 16:9 ist auch nur für Chats erforderlich, nicht für Flow, wo man eh das Format auswählen muss.

    Habe die Google KI gefragt, es wird nur einmal als Life Chat angezeigt, da es kurz ist, hat es sich vielleicht schon erledigt. Wenn es eine Video von einer Stunde oder länger wäre, könnten weitere mit hinzukommen, so nicht mehr.

    Ein paar Stunden geschlafen gehabt, dann mit der Beschreibung auf Spanisch, Deutsch und Englisch begonnen. Bei zwei Sätzen konnte ich machen, was ich wollte, in den Rückübersetzungen war stets deren Sinn vollständig verdreht, von beiden Übersetzern. Also erneut um Hilfe gebeten.


    Nun wollte ich das nicht 15 Minuten vor 08:00 Uhr veröffentlichen, auf 08:00 Uhr eingestellt, und als ich dann aufrief, da dachte ich, ich spinne. War da eine breite Spalte für einen Life Chat. Ich will nicht Chatten, ich will mich wieder hinlegen. Wird wohl ohnehin keiner zum Chat kommen, entfernen lässt sich aber das Häkchen nicht mehr.


    Externer Inhalt www.youtube.com
    Inhalte von externen Seiten werden ohne Ihre Zustimmung nicht automatisch geladen und angezeigt.
    Durch die Aktivierung der externen Inhalte erklären Sie sich damit einverstanden, dass personenbezogene Daten an Drittplattformen übermittelt werden. Mehr Informationen dazu haben wir in unserer Datenschutzerklärung zur Verfügung gestellt.

    Es sollte nur der Schaukelstuhl minimal gedreht werden, dass die Lehne mehr in Richtung der Ecke verweist, doch dann stand wieder alles nicht richtig. Das Schöne an Flow Images, man kann jedes beliebige Bild auswählen und erneut bearbeiten, was bei Whisk schon ähnlich war. Dazu den Bildern neue Namen geben, damit diese sich danach leichter auswählen lassen. Also habe ich nur noch ein paar Krüge abstellen lassen. Genau das ist direkt mit Gemini schwerer, fand ich bisher.


    Um die Situation zu retten, haben wir einen Innenarchitekten bestellt, der auch kurzfristig seine kostenlose Hilfe anbot. Dadurch wurde gleichzeitig die Brandgefahr wesentlich verringert.



    Die Brille sollte ich noch entfernen lassen, fällt mir gerade ein.

    Was mich nervt ist das Video erstellen in Gemini. Früher waren die Videos 8 Sekunden und das Logo deutlich mit Veo.

    Die letzte Szene entwickelt sich gerade ähnlich, sonst wäre ich vielleicht fertig geworden. Habe mich heute Morgen zwar hingelegt, doch schlafen konnte ich nicht, weil nach Lösungen gesucht. Veo 3 oder 3.1 in Flow konnte man ja im April noch aussuchen, ob man mit Lite, Fast oder noch eine andere Version Clips erstellen wollte, weiß nicht mehr, ob die Premium hieß, jedenfalls drei standen da zur Auswahl, diese fehlt jetzt.


    Mein kleiner Drache, unterer Clip mit meinem Prompt, oberer mit einem von Gemini optimierten. Im optimierten legt sie das noch brennende Streichholz nicht mehr auf der Tischplatte ab, nur der Rest. :D



    Und besser als bei Kling, da hatte sie mit beiden Händen die Kerze angezündet uns vermutlich erheblich verbrannt.



    Werde versuchen, doch noch etwas zu schlafen. Da es offensichtlich beide nicht schaffen, überlegen, wie ich die Szene besser anpassen kann.

    Mit Veo hatte das Speisen erstaunlich gut geklappt, nur standen danach zwei Gläser auf dem Tisch.

    (Hintergrundbild wahrscheinlich KI-generiert)

    Denke nicht, es sieht für mich eher nach 3D aus, von jemanden, der ein Image als selbstgemachtes Wasser-Image oder eine Wassertextur verwendete. Die Schatten sind kein bisschen auf der Wasseroberfläche in Bewegung. Die Linienführung des Wassers am ersten Schiffsrumpf sehen für mich nach selbstgemalt aus. Eine KI hätte Wasserbewegung simuliert.

    Nach dem ersten Strandspaziergang habe ich noch einmal das Gebet um 6 Sekunden als Clip verlängert. Das könnte theoretisch an dem ersten folgen, doch ich füge es erst nach der ersten Strandszene ein, dadurch kommt es genau auf die Zeilen:


    Volverás, volverás, (Zurück zu mir, zurück zu mir), das er zu ihr zurückkommen wird.


    Da man dabei keine Referenz laden kann, hat Kling noch etwas mehr auf ihr gezoomt.


    Die Version von Lale Andersen kennen alle älteren User.
    Doch wer kennt das Original?


    Externer Inhalt www.youtube.com
    Inhalte von externen Seiten werden ohne Ihre Zustimmung nicht automatisch geladen und angezeigt.
    Durch die Aktivierung der externen Inhalte erklären Sie sich damit einverstanden, dass personenbezogene Daten an Drittplattformen übermittelt werden. Mehr Informationen dazu haben wir in unserer Datenschutzerklärung zur Verfügung gestellt.

    Nun weiß ich nicht, ob der ganze Chat lesbar ist oder nur der verlinkte Teil. Bin jedenfalls noch auf den letzten Clip von letzter Nach eingegangen, Chat schreibt dazu:

    Zitat

    Der Satz "She prays for her boyfriend to return" ist dabei vermutlich wichtiger, als er auf den ersten Blick wirkt. Das gibt der Szene eine emotionale Richtung. Viele moderne Video-KIs reagieren erstaunlich gut auf solche erzählerischen Hinweise und erzeugen dann automatisch eine Bildsprache, die zu der Stimmung passt.

    Vorher hatte ich auch nur geschrieben, von wo nach wo und wie bewegen.
    Aber die Entwicklung der Modelle geht ja immer weiter.

    Für alle, die es interessieren sollte, habe heute einmal Chat gebeten, mir einmal etwas über unterschiedliche Anbieter und Modelle erzählen.

    Meine Frage war:

    Zitat

    Zwischen den großen Anbietern im Bereich der KI-Imagegeneration gibt es ja Unterschiede. So arbeitet Midjourney mit Parametern, andere versuchen mehr die Bedeutung zu Worten zu erfassen. Dazu kommen Unterschiede, ob es sich um reine Fantasiegebilde handelt, oder möglichst realistisch sein sollte. Kannst du mir etwas darüber erzählen?

    Ich zitiere hier nur die ersten Zeilen, die volle Antwort verlinke ich unten.

    Zitat

    Ja, die Unterschiede sind tatsächlich größer, als viele Nutzer zunächst vermuten. Oft wird über einzelne Modelle gesprochen, als wären sie einfach „besser“ oder „schlechter“, dabei verfolgen sie teilweise ganz unterschiedliche Philosophien

    Die Antwort ist ausführlich geworden, mit kurzen praktischen Beispielen, teilweise bebildert:


    Chat ansehen
    Jemand dachte, dieser Chat könnte dich interessieren.
    chatgpt.com

    Was mich nervt ist das Video erstellen in Gemini.

    Dabei fällt mir noch ein, ich wollte vor Wochen von Gemini eigentlich nur einen Prompt. Wollte für Short-Video einen Steppenadler aus der Vogelperspektive. Dazu hätte die Kamera noch über den Adler sein müssen. Der Adler sollte gefilmt werden, wie er eine Pferdeherde begleitet. Anstatt mir einen Prompt zu liefern, erstellte mir Gemini ein Video im Querformat. Dass es für ein Short-Video in 9:16 gedacht war, ging irgendwie unter im Chat. Sonst habe ich noch keine Videos mit Gemini erstellt.

    Meta AI macht eigentlich auch keine schlechten Bilder, habe jetzt aber schon längere Zeit nichts mehr damit gemacht. Seedance hätte ich einmal ausprobiert, bietet aber keinen Schnupperplan. Soll augenblicklich die Nase vorn im Kopf-an-Kopfrennen haben, aber ich wollte Kling von Anfang an. Ärgerlich fand ich, das meine Debitkarte nicht akzeptiert wurde. Mit dem Support hin und her unterhalten, bis ich mitbekam, dass es auch über Google Play geht, wenn man sich die App fürs Handy installiert. Bei Leonardo bin ich noch.

    Beide Clips hintereinander haben mir nicht gefallen, weil dieser Clip viel braun-toniger ist.

    Der neue Anfang ist nun ein anderer Clip, der sehr viel besser von den Farben passt.

    Dachte mir, in einigen Western mit mexikanischen Viehdieben oder anderen Unholden, eine Kirche war oft als Kulisse dabei.

    Da musste ich mehr Entwürfe rendern lassen, ehe mir eine gefiel, die auch von der Größe passen könnte. Viele waren etwas zu groß für einen kleinen Ort und einige bereits zu sehr verfallen. Bei der ließ ich in der Nacharbeit alle Stromleitungen von den Häusern entfernen und ihr Sandalen anziehen. Einige Überputzleitungen nahm ich noch bei der Retusche weg, ebenfalls eine Wasserzisterne auch einem Dach aus diesem schwarzen Kunststoff.


    Da kam kein Chat drauf, ich ja auch erst heute. Doch ich nehme an, dort könnte es noch mehr zur Tradition gehören, zumindest gehört haben.



    Die meiste Arbeit überließ ich aber Kling, bei der Innenraumgestaltung. Hier die Rückübersetzung vom Prompt:


    "Die junge Frau aus Bild 1 betritt eine kleine mexikanische Kirche (Bild 2) und beginnt dort zu beten. Sie betet für die Rückkehr ihres Freundes und steht dabei vor einem Kreuz, einer Heiligenstatue oder einem Heiligenbild. Die Szene spielt um das Jahr 1900."


    Raumgestaltung war gut gelungen und die Kamerafahrt spitze.



    Es geht weiter.

    Hier hat Kling nicht ganz das gemacht, was ich im Prompt schrieb. So ist das halt zuweilen, doch es ist noch akzeptabel, wiederholen brauche ich es nicht unbedingt. Geschrieben hatte ich, hier in der Rückübersetzung:


    "Eine junge Frau tritt von ganz rechts in das Bild von Bild 1 hinein; ihr Aussehen entspricht dem von Referenzbild 2. Der alte Mann und die junge Frau begrüßen einander und wechseln ein paar Worte, dann setzt die junge Frau ihren Weg fort und ist größtenteils von hinten zu sehen. Beide haben einen freundlichen Gesichtsausdruck, obwohl keiner von beiden lächelt."

    Was mir aber erst im Nachhinein auffiel, ich hatte vor beiden Images das @ Zeichen vergessen, doch Kling hat es dennoch richtig zugeordnet, obwohl die Frau ja noch nicht im Bild für den Startframe enthalten war. Jedenfalls kommt sie jetzt nicht von rechts in die Szene, sondern von der Siedlung den Weg hoch, sagt guten Morgen Vater und er erwidert etwas von Kind und sie geht wieder in Richtung Siedlung den Weg herunter. Und das keiner lächelt, wurde auch nicht beachtet. Bleibt aber noch im Rahmen, denke ich, ist ja noch das Intro.



    Werde erst einmal beides zusammenfügen, ob die Clips so passen.

    So, nun habe ich den Browser gewechselt und Infos geholt, das geht gar nicht den mit Kerzen, schon gar nicht in einer Nische.

    Wer ist hier tot in dem Song, der Text handelt von der Sehnsucht, ähnlich wie in "Ein Schiff wird kommen".




    Wahrscheinlich auch das nicht mit dem Aufbauten auf dem Tisch, weil das auch mehr an einem sltarähnlichen Aufbau mit Kerzen und Heiligenbildchen erinnert.

    dass es bei "Euch" ähnlich ist... :/

    Wie andere das handhaben, weiß ich nicht, aber ich kenne seit rund 20 Jahren einen Spruch, der lautet: "Das Problem sitzt immer vor dem Rechner." Gerade gab ich den bei Google ein, ja der Spruch ist noch bekannt, doch "immer" sollte gegen "meistens" ausgetauscht werden.


    Zumindest sollte man eine Pause einlegen, sonst reihen sich die Fehler. Dabei fällt mir ein, in meiner Jugend, als ich noch Briefe schrieb, einmal verschrieben, bei nächstem Versuch erneut verschrieben, beim dritten wiederum, und wenn ich dann keine Pause einlegte, wurden es einmal 20 Seiten oder so, weil die Fehler immer früher im Text kamen, bevor ich eine längere Pause einlegte. Ist irgendwie menschlich, dass sich Fehler, ohne Pausen einzulegen, häufen können.

    Nun hat sich aus einem völlig vermurksten Bild zum Durchdrehen und Nervenverlieren sich innerhalb von einer Stunde oder etwas mehr noch zwei richtig gute Bilder entwickelt. Also ja, man kann sich mal kurz über diese angebliche Dummheit mächtig aufregen, doch dann muss man wieder selbst zu sich finden, und überlegen, wo eigene Fehler liegen könnten.



    Werde das andere, nunmehr durchaus gelungene, verwenden, weil das besser zur emotionalen Stimmung des Songs passt.

    Anleitung für Nervenschwache - Teil II


    Teil zwei der Anleitung für alle, bei denen etwas einmal nicht klappt.


    So, der zweite Schritt, um sich zu beruhigen und die KI nicht nervös zu machen, und um diese in die richtige Richtung zu bringen.

    Nur der Satz auf Englisch "Bitte drehen Sie den Kopf der jungen Frau zu den beiden Fischern auf der rechten Seite." hat hier nicht gereicht.


    Nachdenken, die KI hat keine Schuld, denn die kann vieles nicht wissen, ist aber lernbereit, wenn man es ihr sachlich, höflich und verständlich erklärt.


    Diese Erklärung hat sie verstanden und beide Seiten waren glücklich und zufrieden:


    "Bitte drehen sie den Kopf der jungen Frau noch mehr in Richtung der beiden Fischer auf der rechten Seite. Es sind gute Bekannte von ihr, denen sie ein Wort zur Begrüßung sagt. Es ist von ihrem Hinterkopf mehr zu sehen."

    Oder auf Englisch:

    Please turn the young woman's head even more toward the two fishermen on the right. They are good friends of hers, and she is saying a quick hello to them. This way, we can see more of the back of her head.


    Im Gegenteil, man sieht nun, dass auch die beiden Fischer kurz von ihrer Arbeit aufblicken, um ihren Gruß zu erwidern: