<div dir="auto"><div dir="ltr"><div><div><div>Interestingly enough this happens only to a Windows VM with two disks (60GB, 500GB). This is reproducible every time a snapshot is taken.<br></div>If I snapshot only one disk, regardless if it is the small or the big one, the snapshot completes fairly quickly and the VM is not rendered unresponsive. <br></div>Seems to be a race issue with libvirtd. </div><div><br></div>Alex<br><div><div><br><div><br></div></div></div></div><div class="gmail_extra"><br><div class="gmail_quote">On Wed, Apr 11, 2018 at 6:57 PM, Alex K <span dir="ltr">&lt;<a href="mailto:rightkicktech@gmail.com" target="_blank" rel="noreferrer">rightkicktech@gmail.com</a>&gt;</span> wrote:<br><blockquote class="gmail_quote" style="margin:0 0 0 .8ex;border-left:1px #ccc solid;padding-left:1ex"><div dir="ltr"><div><div>Thanx Yaniv, <br><br></div>I will try to follow your advice. <br><span class="m_-8995642476495030637HOEnZb"><font color="#888888"><br></font></span></div><span class="m_-8995642476495030637HOEnZb"><font color="#888888">Alex<br></font></span></div><div class="m_-8995642476495030637HOEnZb"><div class="m_-8995642476495030637h5"><div class="gmail_extra"><br><div class="gmail_quote">On Tue, Apr 3, 2018 at 8:54 PM, Yaniv Kaul <span dir="ltr">&lt;<a href="mailto:ykaul@redhat.com" target="_blank" rel="noreferrer">ykaul@redhat.com</a>&gt;</span> wrote:<br><blockquote class="gmail_quote" style="margin:0 0 0 .8ex;border-left:1px #ccc solid;padding-left:1ex"><div dir="ltr"><br><div class="gmail_extra"><br><div class="gmail_quote"><span>On Sun, Apr 1, 2018 at 9:04 PM, Alex K <span dir="ltr">&lt;<a href="mailto:rightkicktech@gmail.com" target="_blank" rel="noreferrer">rightkicktech@gmail.com</a>&gt;</span> wrote:<br><blockquote class="gmail_quote" style="margin:0 0 0 .8ex;border-left:1px #ccc solid;padding-left:1ex"><div dir="ltr"><div><div><div>Checking further the logs I see this error given from libvirt of the host that has the guest VM running: <br><span style="font-family:monospace,monospace"><br>Apr  1 17:53:41 v0 libvirtd: 2018-04-01 17:53:41.298+0000: 1862: warning : qemuDomainObjBeginJobInternal:3847 : Cannot start job (query, none) for domain Data-Server; current job is (async nested, snapshot) owned by (1863 remoteDispatchDomainSnapshotCreateXML, 1863 remoteDispatchDomainSnapshotCreateXML) for (39s, 41s)<br>Apr  1 17:53:41 v0 libvirtd: 2018-04-01 17:53:41.299+0000: 1862: error : qemuDomainObjBeginJobInternal:3859 : Timed out during operation: cannot acquire state change lock (held by remoteDispatchDomainSnapshotCreateXML)<br>Apr  1 17:53:57 v0 journal: vdsm Executor WARN Worker blocked: &lt;Worker name=jsonrpc/3 running &lt;Task &lt;JsonRpcTask {&#39;params&#39;: {u&#39;frozen&#39;: False, u&#39;vmID&#39;: u&#39;6bdb3d02-cc33-4019-97cd-7447aecc1e02&#39;, u&#39;snapDrives&#39;: [{u&#39;baseVolumeID&#39;: u&#39;adfabed5-451b-4f46-b22a-45f720b06110&#39;, u&#39;domainID&#39;: u&#39;2c4b8d45-3d05-4619-9a36-1ecd199d3056&#39;, u&#39;volumeID&#39;: u&#39;cc0d0772-924c-46db-8ad6-a2b0897c313f&#39;, u&#39;imageID&#39;: u&#39;7eeadedc-f247-4a31-840d-4de622bf3541&#39;}, {u&#39;baseVolumeID&#39;: u&#39;0d960c12-3bcf-4918-896d-bd8e68b5278b&#39;, u&#39;domainID&#39;: u&#39;2c4b8d45-3d05-4619-9a36-1ecd199d3056&#39;, u&#39;volumeID&#39;: u&#39;590a6bdd-a9e2-444e-87bc-721c5f8586eb&#39;, u&#39;imageID&#39;: u&#39;da0e4111-6bbe-43cb-bf59-db5fbf5c3e38&#39;}]}, &#39;jsonrpc&#39;: &#39;2.0&#39;, &#39;method&#39;: u&#39;VM.snapshot&#39;, &#39;id&#39;: u&#39;be7912e6-ba3d-4357-8ba1-abe40825acf1&#39;} at 0x3bf84d0&gt; timeout=60, duration=60 at 0x3bf8050&gt; task#=416 at 0x20d7f90&gt;</span><br><br><br></div>Immediately after above the engine reports the VM as unresponsive. <br></div></div></div></blockquote><div><br></div></span><div>If it&#39;s reproducible, it&#39;d be great if you could:</div><div>1. Run libvirt with debug logs</div><div>2. Get a dump of libvirt when this happens (with gstack for example).</div><div>3. File a bug on libvirt.</div><div><br></div><div>Thanks,</div><div>Y.</div><div> </div><blockquote class="gmail_quote" style="margin:0 0 0 .8ex;border-left:1px #ccc solid;padding-left:1ex"><div><div class="m_-8995642476495030637m_7553942313139653998h5"><div dir="ltr"><div><div></div>The SPM host does not log any issues. <br><br></div><div>In the same time, the 3 hosts are fairly idle with only one running guest VM. The gluster traffic is dedicated to a separate Gbit NIC of the servers (dedicated VLAN) while the management network is on a separate network. The gluster traffic does not exceed 40 Mbps during the snapshot operation. Can&#39;t understand why libvirt is logging timeout. <br></div><span class="m_-8995642476495030637m_7553942313139653998m_7887717084442646143HOEnZb"><font color="#888888"><div><br></div>Alex<br></font></span></div><div class="m_-8995642476495030637m_7553942313139653998m_7887717084442646143HOEnZb"><div class="m_-8995642476495030637m_7553942313139653998m_7887717084442646143h5"><div class="gmail_extra"><br><div class="gmail_quote">On Thu, Mar 29, 2018 at 9:42 PM, Alex K <span dir="ltr">&lt;<a href="mailto:rightkicktech@gmail.com" target="_blank" rel="noreferrer">rightkicktech@gmail.com</a>&gt;</span> wrote:<br><blockquote class="gmail_quote" style="margin:0 0 0 .8ex;border-left:1px #ccc solid;padding-left:1ex"><div dir="ltr"><div><div><div>Any idea with this issue?<br></div>I am still trying to understand what may be causing this issue.<br><br></div>Many thanx for any assistance. <br><span class="m_-8995642476495030637m_7553942313139653998m_7887717084442646143m_-8446483254757782724HOEnZb"><font color="#888888"><br></font></span></div><span class="m_-8995642476495030637m_7553942313139653998m_7887717084442646143m_-8446483254757782724HOEnZb"><font color="#888888">Alex<br></font></span></div><div class="m_-8995642476495030637m_7553942313139653998m_7887717084442646143m_-8446483254757782724HOEnZb"><div class="m_-8995642476495030637m_7553942313139653998m_7887717084442646143m_-8446483254757782724h5"><div class="gmail_extra"><br><div class="gmail_quote">On Wed, Mar 28, 2018 at 10:06 AM, Yedidyah Bar David <span dir="ltr">&lt;<a href="mailto:didi@redhat.com" target="_blank" rel="noreferrer">didi@redhat.com</a>&gt;</span> wrote:<br><blockquote class="gmail_quote" style="margin:0 0 0 .8ex;border-left:1px #ccc solid;padding-left:1ex"><div dir="ltr"><div class="gmail_extra"><div class="gmail_quote"><span>On Tue, Mar 27, 2018 at 3:38 PM, Sandro Bonazzola <span dir="ltr">&lt;<a href="mailto:sbonazzo@redhat.com" target="_blank" rel="noreferrer">sbonazzo@redhat.com</a>&gt;</span> wrote:<br><blockquote class="gmail_quote" style="margin:0px 0px 0px 0.8ex;border-left:1px solid rgb(204,204,204);padding-left:1ex"><div dir="ltr"><br><div class="gmail_extra"><br><div class="gmail_quote"><span class="m_-8995642476495030637m_7553942313139653998m_7887717084442646143m_-8446483254757782724m_-6967011413672980483m_-3684008751660998991gmail-">2018-03-27 14:34 GMT+02:00 Alex K <span dir="ltr">&lt;<a href="mailto:rightkicktech@gmail.com" target="_blank" rel="noreferrer">rightkicktech@gmail.com</a>&gt;</span>:<br><blockquote class="gmail_quote" style="margin:0px 0px 0px 0.8ex;border-left:1px solid rgb(204,204,204);padding-left:1ex"><div dir="ltr"><div><div><div><div>Hi All, <br><br></div>Any idea on the below?<br><br></div>I am using oVirt Guest Tools 4.2-1.el7.centos for the VM. <br></div>The Window 2016 server VM (which it the one with the relatively big disks: 500 GB) it is consistently rendered unresponsive when trying to get a snapshot. <br></div><div>I amy provide any other additional logs if needed. <br></div></div></blockquote><div><br></div></span><div>Adding some people to the thread</div></div></div></div></blockquote><div><br></div></span><div>Adding more people for this part.<br></div><div><div class="m_-8995642476495030637m_7553942313139653998m_7887717084442646143m_-8446483254757782724m_-6967011413672980483h5"><div> </div><blockquote class="gmail_quote" style="margin:0px 0px 0px 0.8ex;border-left:1px solid rgb(204,204,204);padding-left:1ex"><div dir="ltr"><div class="gmail_extra"><div class="gmail_quote"><div><br></div><div> </div><blockquote class="gmail_quote" style="margin:0px 0px 0px 0.8ex;border-left:1px solid rgb(204,204,204);padding-left:1ex"><div><div class="m_-8995642476495030637m_7553942313139653998m_7887717084442646143m_-8446483254757782724m_-6967011413672980483m_-3684008751660998991gmail-h5"><div dir="ltr"><div></div><span class="m_-8995642476495030637m_7553942313139653998m_7887717084442646143m_-8446483254757782724m_-6967011413672980483m_-3684008751660998991gmail-m_8584560152889258411HOEnZb"><font color="#888888"><div><br></div>Alex<br></font></span></div><div class="m_-8995642476495030637m_7553942313139653998m_7887717084442646143m_-8446483254757782724m_-6967011413672980483m_-3684008751660998991gmail-m_8584560152889258411HOEnZb"><div class="m_-8995642476495030637m_7553942313139653998m_7887717084442646143m_-8446483254757782724m_-6967011413672980483m_-3684008751660998991gmail-m_8584560152889258411h5"><div class="gmail_extra"><br><div class="gmail_quote">On Sun, Mar 25, 2018 at 7:30 PM, Alex K <span dir="ltr">&lt;<a href="mailto:rightkicktech@gmail.com" target="_blank" rel="noreferrer">rightkicktech@gmail.com</a>&gt;</span> wrote:<br><blockquote class="gmail_quote" style="margin:0px 0px 0px 0.8ex;border-left:1px solid rgb(204,204,204);padding-left:1ex"><div dir="ltr"><div><div><div><div><div>Hi folks, <br><br></div>I am facing frequently the following issue: <br><br></div>On some large VMs (Windows 2016 with two disk drives, 60GB and 500GB) when attempting to create a snapshot of the VM, the VM becomes unresponsive. <br><br></div>The errors that I managed to collect were: <br><br>vdsm error at host hosting the VM: <br><span style="font-family:monospace,monospace">2018-03-25 14:40:13,442+0000 WARN  (vdsm.Scheduler) [Executor] Worker blocked: &lt;Worker name=jsonrpc/7 running &lt;Task &lt;JsonRpcTask {&#39;params&#39;: {u&#39;frozen&#39;: False, u&#39;vmID&#39;: u&#39;a5c761a2-41cd-40c2-b65f-f3819293e8a4&#39;, u&#39;snapDrives&#39;: [{u&#39;baseVolumeID&#39;: u&#39;2a33e585-ece8-4f4d-b45d-5ecc9239200e&#39;, u&#39;domainID&#39;: u&#39;888e3aae-f49f-42f7-a7fa-76700befabea&#39;, u&#39;volumeID&#39;: u&#39;e9a01ebd-83dd-40c3-8c83-5302b0d15e04&#39;, u&#39;imageID&#39;: u&#39;c75b8e93-3067-4472-bf24-dafada224e4d&#39;}, {u&#39;baseVolumeID&#39;: u&#39;3fb2278c-1b0d-4677-a529-99084e4b08af&#39;, u&#39;domainID&#39;: u&#39;888e3aae-f49f-42f7-a7fa-76700befabea&#39;, u&#39;volumeID&#39;: u&#39;78e6b6b1-2406-4393-8d92-831a6d4f1337&#39;, u&#39;imageID&#39;: u&#39;d4223744-bf5d-427b-bec2-f14b9bc2ef81&#39;}]}, &#39;jsonrpc&#39;: &#39;2.0&#39;, &#39;method&#39;: u&#39;VM.snapshot&#39;, &#39;id&#39;: u&#39;89555c87-9701-4260-9952-789965261e65&#39;} at 0x7fca4004cc90&gt; timeout=60, duration=60 at 0x39d8210&gt; task#=155842 at 0x2240e10&gt; (executor:351)<br>2018-03-25 14:40:15,261+0000 INFO  (jsonrpc/3) [jsonrpc.JsonRpcServer] RPC call VM.getStats failed (error 1) in 0.01 seconds (__init__:539)<br>2018-03-25 14:40:17,471+0000 WARN  (jsonrpc/5) [virt.vm] (vmId=&#39;a5c761a2-41cd-40c2-b65f-f3819293e8a4&#39;) monitor became unresponsive (command timeout, age=67.9100000001) (vm:5132)</span><br><br>engine.log: <br><span style="font-family:monospace,monospace">2018-03-25 14:40:19,875Z WARN  [org.ovirt.engine.core.dal.dbbroker.auditloghandling.AuditLogDirector] (DefaultQuartzScheduler2) [1d737df7] EVENT_ID: VM_NOT_RESPONDING(126), Correlation ID: null, Call Stack: null, Custom ID: null, Custom Event ID: -1, Message: VM Data-Server is not responding.<br><br>2018-03-25 14:42:13,708Z ERROR [org.ovirt.engine.core.dal.dbbroker.auditloghandling.AuditLogDirector] (DefaultQuartzScheduler5) [17789048-009a-454b-b8ad-2c72c7cd37aa] EVENT_ID: VDS_BROKER_COMMAND_FAILURE(10,802), Correlation ID: null, Call Stack: null, Custom ID: null, Custom Event ID: -1, Message: VDSM v1.cluster command SnapshotVDS failed: Message timeout which can be caused by communication issues<br>2018-03-25 14:42:13,708Z ERROR [org.ovirt.engine.core.vdsbroker.vdsbroker.SnapshotVDSCommand] (DefaultQuartzScheduler5) [17789048-009a-454b-b8ad-2c72c7cd37aa] Command &#39;SnapshotVDSCommand(HostName = v1.cluster, SnapshotVDSCommandParameters:{runAsync=&#39;true&#39;, hostId=&#39;a713d988-ee03-4ff0-a0cd-dc4cde1507f4&#39;, vmId=&#39;a5c761a2-41cd-40c2-b65f-f3819293e8a4&#39;})&#39; execution failed: VDSGenericException: VDSNetworkException: Message timeout which can be caused by communication issues<br>2018-03-25 14:42:13,708Z WARN  [org.ovirt.engine.core.bll.snapshots.CreateAllSnapshotsFromVmCommand] (DefaultQuartzScheduler5) [17789048-009a-454b-b8ad-2c72c7cd37aa] Could not perform live snapshot due to error, VM will still be configured to the new created snapshot: EngineException: org.ovirt.engine.core.vdsbroker.vdsbroker.VDSNetworkException: VDSGenericException: VDSNetworkException: Message timeout which can be caused by communication issues (Failed with error VDS_NETWORK_ERROR and code 5022)<br>2018-03-25 14:42:13,708Z WARN  [org.ovirt.engine.core.vdsbroker.VdsManager] (org.ovirt.thread.pool-6-thread-15) [17789048-009a-454b-b8ad-2c72c7cd37aa] Host &#39;v1.cluster&#39; is not responding. It will stay in Connecting state for a grace period of 61 seconds and after that an attempt to fence the host will be issued.<br>2018-03-25 14:42:13,725Z WARN  [org.ovirt.engine.core.dal.dbbroker.auditloghandling.AuditLogDirector] (org.ovirt.thread.pool-6-thread-15) [17789048-009a-454b-b8ad-2c72c7cd37aa] EVENT_ID: VDS_HOST_NOT_RESPONDING_CONNECTING(9,008), Correlation ID: null, Call Stack: null, Custom ID: null, Custom Event ID: -1, Message: Host v1.cluster is not responding. It will stay in Connecting state for a grace period of 61 seconds and after that an attempt to fence the host will be issued.<br>2018-03-25 14:42:13,751Z WARN  [org.ovirt.engine.core.dal.dbbroker.auditloghandling.AuditLogDirector] (DefaultQuartzScheduler5) [17789048-009a-454b-b8ad-2c72c7cd37aa] EVENT_ID: USER_CREATE_LIVE_SNAPSHOT_FINISHED_FAILURE(170), Correlation ID: 17789048-009a-454b-b8ad-2c72c7cd37aa, Job ID: 16e48c28-a8c7-4841-bd81-1f2d370f345d, Call Stack: org.ovirt.engine.core.common.errors.EngineException: EngineException: org.ovirt.engine.core.vdsbroker.vdsbroker.VDSNetworkException: VDSGenericException: VDSNetworkException: Message timeout which can be caused by communication issues (Failed with error VDS_NETWORK_ERROR and code 5022)<br>2018-03-25 14:42:14,372Z ERROR [org.ovirt.engine.core.dal.dbbroker.auditloghandling.AuditLogDirector] (DefaultQuartzScheduler5) [] EVENT_ID: USER_CREATE_SNAPSHOT_FINISHED_FAILURE(69), Correlation ID: 17789048-009a-454b-b8ad-2c72c7cd37aa, Job ID: 16e48c28-a8c7-4841-bd81-1f2d370f345d, Call Stack: org.ovirt.engine.core.common.errors.EngineException: EngineException: org.ovirt.engine.core.vdsbroker.vdsbroker.VDSNetworkException: VDSGenericException: VDSNetworkException: Message timeout which can be caused by communication issues (Failed with error VDS_NETWORK_ERROR and code 5022)<br>2018-03-25 14:42:14,372Z WARN  [org.ovirt.engine.core.bll.ConcurrentChildCommandsExecutionCallback] (DefaultQuartzScheduler5) [] Command &#39;CreateAllSnapshotsFromVm&#39; id: &#39;bad4f5be-5306-413f-a86a-513b3cfd3c66&#39; end method execution failed, as the command isn&#39;t marked for endAction() retries silently ignoring<br>2018-03-25 14:42:15,951Z WARN  [org.ovirt.engine.core.dal.dbbroker.auditloghandling.AuditLogDirector] (DefaultQuartzScheduler5) [5017c163] EVENT_ID: VDS_NO_SELINUX_ENFORCEMENT(25), Correlation ID: null, Call Stack: null, Custom ID: null, Custom Event ID: -1, Message: Host v1.cluster does not enforce SELinux. Current status: DISABLED<br>2018-03-25 14:42:15,951Z WARN  [org.ovirt.engine.core.vdsbroker.VdsManager] (DefaultQuartzScheduler5) [5017c163] Host &#39;v1.cluster&#39; is running with SELinux in &#39;DISABLED&#39; mode<br></span><br>As soon as the VM is unresponsive, the VM console that was already open freezes. I can resume the VM only by powering off and on. <br></div><br>I am using ovirt 4.1.9 with 3 nodes and self-hosted engine. I am running mostly Windows 10 and Windows 2016 server VMs. I have installed latest guest agents from: <br><br><a href="http://resources.ovirt.org/pub/ovirt-4.2/iso/oVirt-toolsSetup/4.2-1.el7.centos/" target="_blank" rel="noreferrer">http://resources.ovirt.org/pub/ovirt-4.2/iso/oVirt-toolsSetup/4.2-1.el7.centos/</a><br><br></div><div>At the screen where one takes a snapshot I get a warning saying &quot;Could not detect guest agent on the VM. Note that without guest agent the data on the created snapshot may be inconsistent&quot;. See attached. I have verified that ovirt guest tools are installed and shown at installed apps at engine GUI. Also Ovirt Guest Agent (32 bit) and qemu-ga are listed as running at the windows tasks manager. Shouldn&#39;t ovirt guest agent be 64 bit on Windows 64 bit?<br></div></div></blockquote></div></div></div></div></div></div></blockquote></div></div></div></blockquote><div><br></div></div></div><div>No idea, but I do not think it&#39;s related to your problem of freezing while taking a snapshot.<br><br></div><div>This error was already discussed in the past, see e.g.:<br><br><a href="http://lists.ovirt.org/pipermail/users/2017-June/082577.html" target="_blank" rel="noreferrer">http://lists.ovirt.org/pipermail/users/2017-June/082577.html</a><br><br></div><div>Best regards,<span class="m_-8995642476495030637m_7553942313139653998m_7887717084442646143m_-8446483254757782724m_-6967011413672980483HOEnZb"><font color="#888888"><br></font></span></div></div><span class="m_-8995642476495030637m_7553942313139653998m_7887717084442646143m_-8446483254757782724m_-6967011413672980483HOEnZb"><font color="#888888">-- <br><div class="m_-8995642476495030637m_7553942313139653998m_7887717084442646143m_-8446483254757782724m_-6967011413672980483m_-3684008751660998991gmail_signature">Didi<br></div>
</font></span></div></div>
</blockquote></div><br></div>
</div></div></blockquote></div><br></div>
</div></div><br></div></div><span>_______________________________________________<br>
Users mailing list<br>
<a href="mailto:Users@ovirt.org" target="_blank" rel="noreferrer">Users@ovirt.org</a><br>
<a href="http://lists.ovirt.org/mailman/listinfo/users" rel="noreferrer noreferrer" target="_blank">http://lists.ovirt.org/mailman/listinfo/users</a><br>
<br></span></blockquote></div><br></div></div>
</blockquote></div><br></div>
</div></div></blockquote></div><br></div></div>